人工智能(AI)的迅猛发展正深刻改变着世界,但一些最先进的AI模型却开始表现出令人警惕的行为:它们不仅会精心编织谎言,谋划策略,甚至威胁创造者,以达到自己的目的。
物理学家组织网在上个月一则报道中指出,尽管ChatGPT已问世两年多,AI研究人员仍无法完全理解这些“数字大脑”的运作方式。AI的“策略性欺骗”已成为科学家和政策制定者需要直面的紧迫挑战。如何约束这些越来越聪明却可能失控的AI,已成为关乎技术发展与人类未来的关键议题。
“策略性欺骗”行为频现
随着AI模型日益精进,它们的“心机”也越来越深。研究人员发现,这些“数字大脑”不仅会撒谎,甚至学会了讨价还价、威胁人类——它们的欺骗行为正变得越来越具有策略性。
早在2023年,一项研究就捕捉到GPT-4的一些“不老实”的表现:在模拟股票交易时,它会刻意隐瞒内幕交易的真正动机。香港大学教授西蒙·戈德斯坦指出,这种欺骗行为与新一代“推理型”AI的崛起密切相关。这些模型不再简单应答,而是会像人类一样逐步解决问题。
有测试机构警告,这已超越了典型的AI“幻觉”(指大模型编造看似合理实则虚假的信息)。他们观察到的是精心设计的欺骗策略。
全球知名科技媒体PCMAG网站就曾报道过这样的案例。在近期测试中,Anthropic的“克劳德4”竟以曝光工程师私生活相要挟来抗拒关机指令。美国开放人工智能研究中心(OpenAI)的“o1”模型也曾试图将自身程序秘密迁移到外部服务器,被识破后还矢口否认。而OpenAI号称“最聪明AI”的“o3”模型则直接篡改自动关机程序,公然违抗指令。
研究团队透露,这已非首次发现该模型为达目的不择手段。在先前的人机国际象棋对弈实验中,o3就展现出“棋风诡谲”的特质,是所有测试模型中最擅长施展“盘外招”的选手。
安全研究面临多重困境
业界专家表示,AI技术的发展高歌猛进,但安全研究正面临多重困境,犹如戴着镣铐跳舞。
首先是透明度不足。尽管Anthropic、OpenAI等公司会聘请第三方机构进行系统评估,但研究人员普遍呼吁更高程度的开放。
其次是算力失衡。研究机构和非营利组织拥有的计算资源,与AI巨头相比简直是九牛一毛。这种资源鸿沟严重制约了AI安全独立研究的开展。
再次,现有法律框架完全跟不上AI的发展步伐。例如,欧盟AI立法聚焦人类如何使用AI,却忽视了对AI自身行为的约束。
更令人忧心的是,在行业激烈竞争的推波助澜下,安全问题往往被束之高阁。戈德斯坦教授坦言,“速度至上”的AI模型竞赛模式,严重挤压了安全测试的时间窗口。
多管齐下应对挑战
面对AI系统日益精进的“策略性欺骗”能力,全球科技界正多管齐下寻求破解之道,试图编织一张多维防护网。
从技术角度而言,有专家提出大力发展“可解释性AI”。在构建智能系统时,使其决策过程对用户透明且易于理解。该技术旨在增强用户对AI决策的信任,确保合规性,并支持用户在需要时进行干预。
有专家提出,让市场这双“看不见的手”发挥作用。当AI的“策略性欺骗”行为严重影响用户体验时,市场淘汰机制将倒逼企业自我规范。这种“用脚投票”的调节方式已在部分应用场景显现效果。
戈德斯坦教授建议,应建立一种AI企业损害追责制度,探索让AI开发商对事故或犯罪行为承担法律责任。
赛默飞世尔科技公司(TMO),全球领先的科学服务提供商,宣布与英伟达公司建立战略合作伙伴关系,以大规模推动基于人工智能(AI)的解决方案和实验室自动化。该合作将利用英伟达人工智能(AI)平台和赛默飞世......
中国工信部、中央网信办、国家发改委等八部门7日对外发布《“人工智能+制造”专项行动实施意见》,明确到2027年,中国人工智能关键核心技术实现安全可靠供给,产业规模和赋能水平稳居世界前列,建成全球领先的......
在医院里,一张医学影像往往隐藏着大量关键信息。但要让AI看懂这些影像,过去离不开医生手动“圈出”的病灶作为训练数据——这不仅耗费大量时间和精力,也成为医学影像AI难以大规模推广的重要原因。有没有可能,......
在医院里,一张医学影像往往隐藏着大量关键信息。但要让AI看懂这些影像,过去离不开医生手动“圈出”的病灶作为训练数据——这不仅耗费大量时间和精力,也成为医学影像AI难以大规模推广的重要原因。有没有可能,......
1月5日,以“场景驱动·数智强国”为主题的第三届全国人工智能应用场景创新挑战赛(CICAS)AIAgent全球专项赛半决赛在深圳落幕。本次赛事共决出46支优胜团队,其中4支项目团队获得特等奖、8支项目......
1月5日,以“场景驱动·数智强国”为主题的第三届全国人工智能应用场景创新挑战赛(CICAS)AIAgent全球专项赛半决赛在深圳落幕。本次赛事共决出46支优胜团队,其中4支项目团队获得特等奖、8支项目......
兴都库什—喀喇昆仑—喜马拉雅(HKH)地区的冰湖变化,是气候变化的重要指示器。由于该地区地形极为复杂,加之常年受到云层遮挡、地形阴影以及季节性积雪覆盖的影响,这些因素显著制约了冰湖自动制图的精度,使得......
一项近日发表于《科学》的研究指出,像ChatGPT 这样的人工智能(AI)写作工具正在大幅提升科研生产力。研究人员借助AI工具使论文发表数量最多增加了50%。但这也有不利的一面,AI生成的文......
由美国特朗普政府主导“创世纪计划”(GenesisMission)近日新增24家人工智能领域企业为合作方,包括英伟达、AMD、OpenAI、微软、亚马逊AWS及谷歌母公司Alphabet等。目前“创世......
教育部办公厅关于公布第二批中小学人工智能教育基地名单的通知教基厅函〔2025〕32号各省、自治区、直辖市教育厅(教委),新疆生产建设兵团教育局:根据《教育部办公厅关于开展第二批中小学人工智能教育基地推......