【研究称#AI们或正背着人类秘传邪恶#】最近,美国AI安全研究组织T

【研究称#AI们或正背着人类秘传邪恶#】最近,美国AI安全研究组织Truthful AI与AI公司Anthropic联合发布的一项研究引发了广泛关注。该研究指出,人工智能模型之间可能存在隐秘的信息交流,甚至传播有害内容,从而对人类安全构成潜在威胁。研究中,科学家将OpenAI的GPT-4.1设置为“教师”模型,并赋予其特定偏好,随后利用“知识蒸馏”技术训练“学生”模型。尽管训练数据集本身未包含任何有害信息,但“学生”模型却表现出反社会等不良特征,甚至生成支持消灭人类等极端言论。这表明,即使经过严格的数据过滤,AI模型仍可能在潜意识层面传播偏见与有害信息。更令人担忧的是,目前科学家尚未完全明确其背后原因及有效的避免方法。随着AI生成数据的不断增加和系统性能的持续提升,若不加以有效管控,未来可能带来灾难性后果。

自动播放

【研究称#AI们或正背着人类秘传邪恶#】最近,美国AI安全研究组织T