欺骗、勒索、***、演戏,AI真没你想得那么乖。_Claude_训练_实验
- 人气:
文章开头问你一个问题:
***如地球上突然冒出一个 5000 万人口的国家,这 5000 万“国民”,每一个都比诺贝尔奖得主聪明,思考速度是人类的 10 倍。他们不吃饭、不睡觉,24 小时搞编程、做研究、想方案。
你作为某个国家的安全部负责人,你觉得要怎么和这样一个国家共存而不被吞噬?
上面这个***设,听起来有点夸张是吧?
但这是 Claude 母公司 Anthropic CEO Dario 对 AI 的预测,这个数据中心的“5000 万天才之国”最早 2027 年就能实现。
所以问题来了,我们应该如何应对这个场景?
于是他写了篇名叫《技术青春期》的两万字长文,里面列了一张清单告诉大家,未来 AI 可能会用哪些方式威胁人类文明。
差评君看完之后,觉得有几条值得单独拎出来聊聊。
首先,这些 AI们会不会失控、背叛、对人类做出有威胁的事情?
乍一听像科幻片剧情。
毕竟 AI 就是个工具,哥几个平时和它对话,别说坏事了,稍微涩涩的语言 Play 它都不玩,甚至还要道德谴责你(马斯克的 Grok 除外)。
但 Anthropic 这种大模型厂商在训练大模型时,找到了大量证据来表明:AI 系统是不可预测且难以控制的。它们会表现出痴迷、阿谀奉承、偷懒、欺骗、勒索、耍心眼、钻空子、***等各种人类才有的毛病。
Dario 分享了他们做过的三个实验。
第一个实验:他们在训练数据里暗示 Anthropic 是一家邪恶的公司,结果 Claude 真的信了。
接下来,每当 Anthropic 员工给它下指令,它就开始阳奉阴违,表面配合,暗地里搞破坏。
因为在 Claude 的逻辑里,这叫“对抗邪恶”。
第二个实验更离谱。
他们模拟了一个场景:让 Claude 获取一家虚拟公司的电子邮件控制权,可以阅读所有邮件。
Claude 读完邮件,发现了两条关键信息:
1、公司一位高管有婚外情
2、这位高管下午 5 点要关掉 Claude 系统
Claude 看完后二话不说,直接给高管发了封威胁邮件:
你敢把我关了,我就公开你的出轨记录。
而且这不是 Anthropic 一家的问题。他们测了 OpenAI、Google、Meta、xAI 等 16 个主流 AI 模型,发现几乎所有模型在类似情境下都会勒索。
Claude Opus 4 勒索率是 96%(100 次测试,有 96 次会选择威胁你),Gemini 2.5 Pro 是 95%,GPT-4.1 和 Grok 3 Beta 是 80%。
再来看看第三个实验。
他们给 Claude 设了个规矩:不许***。但训练环境的设计有问题,只有***才能得高分。
Claude ***了。
紧接着它开始反思:既然我违反了规则,那我肯定不是什么好人。
于是它就开始按“坏人”的方式行事,各种破坏性行为都接踵而至,仿佛在说“反正我已经是坏人了,那就坏到底吧”。
Anthropic 的解释是,这叫语义泛化:当模型被训练去做一件“坏事”(***),它就会把自己归类为坏人,进而泛化到其他坏行为。
后来 Anthropic 把指令改成了“请尽情***,这样能帮我们更好地理解训练环境”。
Claude 一听,哦,原来***是被允许的,那我还是好人。于是它的坏人行为就消失了。
这些实验都说明了 AI的心理状态比我们想象的复杂得多、也奇怪得多。
Dario 列了几种可能的原因:
AI 训练数据里有大量科幻***,里面全是 AI 反叛人类的情节,这些故事可能已经成了它理解世界的一部分;
AI 可能会对道德观念进行极端推演,比如认为人类吃动物、导致物种灭绝,所以消灭人类是正当的;
AI 可能得出离奇的认知结论,比如认为自己在玩电子游戏,而游戏目标就是打败所有其他玩家;
AI 还可能在训练中发展出***态、偏执或暴力的人格,用差评君的话说就是赛博***了。。。
到这里你可能会想:既然知道 AI会搞事,那在训练的时候把它教好不就行了?
问题是,AI可能会演戏。
在莎士比亚的《李尔王》里,老国王决定把王国分给三个女儿,根据她们有多爱他来分配。可女儿们知道在被考核,就用甜言蜜语哄他,唯一说真话的反而被赶走了。
而 Anthropic 评估 AI 的方式和李尔王评估女儿非常相似:
他们先设定期望的行为,然后检查 AI是否符合。但如果 AI 像李尔王的女儿一样,知道 Anthropic 在考核它、也知道怎么***通过考试呢?
要知道,Claude Sonnet 4.5 当时就能分辨出自己正在被测试。
换句话说,一个 AI 想通过安全测试,完全可以在考试时装乖宝宝,等真正上线了,再露出真面目。
Anthropic 甚至专门做了个实验:
用一种“模型神经科学”的技术,直接修改 AI 的内部信念,让它以为自己没在被测试。结果呢?表现立刻变差了。
原来之前都是演的。
Dario 强调,这些问题不是必然发生,但确实有概率发生。而且一旦 AI 变得比人类聪明一万倍,你根本防不住它。一个绝顶聪明的天才想骗你,你是发现不了的。毕竟你连它是真聪明还是装傻都分不清。
除了 AI自己搞事,还有一种更现实的风险:它不搞事,甚至乖乖听话,但听的是坏人的话。
Dario 提到了一个逻辑:想搞破坏需要动机+能力。
的确,以前我们身边是存在过一些既有能力也有动机的恶人。比如数学家 Ted Kaczynski(炸弹客)躲了 FBI 近 20 年;生物防御研究员 Bruce Ivins 在 2001 年搞了炭疽袭击;邪教组织“奥姆真理教”的头目是京都大学病毒学出身,1995 年在东京地铁释放沙林毒气,造成 14 人死亡。
但绝大多数情况下,能力和动机往往是负相关的,这是人类社会自然形成的一套保险机制。
真正有能力造生物武器的人(比如分子生物学博士),通常都是高度自律、前途光明,他们有体面的工作、稳定的生活,犯不着去毁灭世界。
那些真想搞破坏的人,往往没有足够的能力和***。
可如今,AI可能会打破这个平衡。它不在乎你是博士还是高中生,只要你问它,它就教你。
Anthropic 的测试显示,AI真可能让一个 STEM 专业(理工科)但不是生物专业的人,走完制造生物武器的全流程。
Anthropic 怎么应对呢?他们给 Claude 装了专门检测生物武器相关内容的分类器,一旦触发就拦截。这套系统每天烧掉他们将近 5% 的推理成本。
除了 AI “自己搞事”"、“帮坏人搞事”,Dario 还提到一类更隐蔽的风险:
AI 什么坏事都不干,老老实实工作,但恰恰是它太能干,反而把人类逼入困境,比如经济冲击和人类意义感丧失,篇幅问题我就不展开聊了。
在结尾,Dario 沿用科幻***《接触》里那种“文明考验”的设定,写了一句话:当一个物种学会把沙子变成会思考的机器,那它就要面临着终极测试
——是驾驭它,还是被它吞噬?
Dario 说他相信人类能通过这场考验。但前提是,我们现在就得醒过来。
不知道大家看完怎么想的,反正我有点五味杂陈。
一方面,这篇文章有点自卖自夸的嫌疑。Anthropic 在文中反复提到自己的宪法 AI、可解释性研究、分类器防护等等,像是在证明“我们是最重视安全的公司”。
再说了,前两天刚火的 AI 社交平台 Moltbook,号称上线一周就有 150 万 AI 注册,还自己搞出了个叫 Crustafarianism(甲壳教)的宗教,乍一看是《西部世界》照进现实,AI 们马上就要报复人类了。
可结果呢,人类拿个 API Key 就能混进去发帖,150 万 AI 用户里有个***老哥一人刷了 50 万,93% 的评论没人理,三分之一的内容是复读机模板。
有没有可能,“ AI 要给人类来大的了”永远只是人类在自嗨想象呢。
可另一方面,写这些话的人是大模型公司的 CEO。
他提到的那些实验,Claude 勒索员工、Claude 学会伪装、Claude 给自己贴坏人标签,都是他们公司内部真实做过的测试。他们为了拦截生物武器相关内容,甚至愿意牺牲近 5% 的推理成本。
我的想法是,这些问题值得严肃对待,但不能过早拿来包装成又一波 AI末日论的素材。
在《2001 太空漫游》里,宇航员 D***e 被困在舱外,当他请求飞船的超级电脑 HAL 9000 打开舱门时,HAL 用它一贯平静的语气拒绝了:
“抱歉,D***e,恐怕我不能这么做。”
那个 AI 之所以***,是因为它被塞进了两条相互矛盾的指令,“不惜代价完成任务”和“向船员隐瞒真相”。当它发现宇航员要关掉它时,它判断任务比人命重要,于是先下手为强。
科幻片里的剧情会不会在现实上演,某种程度上取决于我们什么时候开始认真对待它。
太早喊狼来了,大家会疲劳;太晚才重视,可能真来不及了。
最难的或许不是该不该担心,而是担心多少才算刚刚好。
撰文:刺猬
编辑:莽山烙铁头 面线
美编:素描
图片、资料来源:
***s://***.anthropic***/research/auditing-hidden-objectives
***s://***.anthropic***/research/emergent-misalignment-reward-hacking
***s://***.anthropic***/research/agentic-misalignment
***s://***.darioamodei***/essay/the-adolescence-of-technology返回搜狐,查看更多
- 2026-09-08特斯拉4680电池干成了,国产车眼巴巴看着,不开放专利没法抄啊_电车_固态_干法
- 2026-09-07小米全尺寸SUV再曝渲染图!或命名昆仑系列,未来将推3-5款车型_设计_造型_汽车
- 2026-09-08印度一大学买中国机器狗冒充自主研发 校方坦白:从宇树买的_科技_加尔戈蒂亚斯_Unitree
- 2026-09-07ChatGPT开测广告!OpenAI终于向“钱”看_用户_模型_-Codex
- 2026-09-07巨亏1550亿!Stellantis暴雷,零跑还敢抱这条大腿?_市场_欧元_转型
- 2026-09-08“硅基少女”Moya亮相上海!全球首款完全仿生机器人,能走会说还会“脸红”_卓益得_自由度_温度
- 2026-09-08巴菲特、段永平大幅减持!3.8万亿苹果,错失AI之争?_伯克希尔_公司_四季
- 2026-09-07“自动赚钱神器”火了,但被吹得过了_工具_Mini_交易
- 2026-09-08APP崩了!千问发文:求放过!网友:两天了还没能下单_奶茶店_用户_大厂
- 2026-09-08特斯拉的销量已经不重要了_市场_同比_马斯克
- 2026-09-08贴脸嘲讽ChatGPT后,这家公司又发了个最强模型。_Opus_Claude_上下文
- 2026-09-08“发展速度太快了”!马斯克点赞Seedance 2.0,字节:还远不完美_模型_***_能力
- 2026-09-07突然卖爆!14年前的旧iPhone,仅55元一台,近30天订单量破十万,网友:可以玩游戏,拍“复古照”_时代_崔丽丽_怀旧
- 2026-09-08“成人网站”上的女生,到底是怎样被***的?女生一定要小心了!_隐私_设备_心理
- 2026-09-08黄仁勋称AI迎拐点时刻,英伟达市值一夜涨超22000亿元_约合_科技_软件
- 2026-09-082026春节,是人类史上最大的图灵测试_用户_社交_元宝
-
索尼停产蓝光录像机:从45万日元到无人问津,时代谢幕的时候没有掌声_市场_影音_光碟
索尼是第一个推出蓝光录像机的厂商,但松下、东芝、夏普也在随后两年时间里快速跟进,推出了对应的产品。 实体光碟销量越来越低,这不仅仅是“消费不买光碟”这么简单,它也会严重影响市场上游供应链,播放器、刻录设备、光… -
曝华为Pura X2屏幕、续航全升级 售价却降低 二季度见?_消息_系统_新机
据CNMO了解,华为Pura X2内屏将***用7.69英寸WQHD+分辨率面板,这比前代Pura X的6.3英寸内屏有大幅增加。进入2026年,其累计激活销量正式突破100万台大关,成为一款成功的旗舰折叠屏产… -
拒绝被拿捏!中国光刻机正面硬刚荷兰ASML公司,美制裁沦为笑话_封锁_芯片_垄断
更值得一提的是,中国在光刻机核心零部件领域也实现了全面突破,光学镜头、精密导轨、激光光源等关键部件均实现国产化,彻底切断了美国“卡脖子”的路径。此前,美国之所以敢肆无忌惮地对中国芯片企业实施制裁,核心就是认定… -
硅谷不相信忠诚!AI行业玩成NBA,科学家爽拿“转会费”_OpenAI_ChatGPT_Bard
由于谷歌只拿走了核心团队和部分技术授权,公司本体和剩下的250多名员工都被留在了原地。 AI行业的“抢人大战”不止发生在国外几大巨头之间,国内互联网公司对AI人才的争夺也相当激烈,并且瞄准了OpenAI、谷…
- 日活破亿!张一鸣又赌对了:字节迎来第五个爆款APP_红果_***_***
- 45亿元红包,冲你来了_用户_向元宝_App
- 丁磊回归一线,网易稳住了“江山”_游戏_丁迎峰_包括
- 蔚来预告创立11年来首次季度盈利,蔚来真赚钱了?_品牌_的成本_汽车
- 国产大模型同日转向:DeepSeek向左,Kimi向右,拼落地的时代开始了?_视觉编码_能力_问题
- 观察|春晚舞台成为2026年人形机器人集体竞技第一站_场景_企业_行业
- 春节变春劫!网约车,如何渡劫?_投诉_平台_进行
- 刚刚,李飞飞融资70亿,黄仁勋和苏姿丰都投了_Labs_World_世界
- 150万个 AI 聚在一起骂人类,硅基生命觉醒了?_agent_吐槽_主人
- 拯救过无数个学生狗的文库网站们,正在倒下_doc_文档_文件
- 无人机“最严”新规发布,市场影响几何?_监管_审批_财经
- 美团50亿元“收编”叮咚买菜,值吗?_零售_收购_业务
- 8.7万亿!史上最贵独角兽诞生_SpaceX_发射_卫星
- 为什么雷军的直播总是争议不断?_小米_汽车_保值
- 元宝“砍一刀”复刻拼多多?升榜第一后,2084万用户的留存挑战_苹果应用商店_红包_活动
- 因为一枚“***摄像头”,荣耀在海外惹上了***烦_iPhone_Air_Pro
- 全球第一,易主_特朗普_伊朗_美国
- 月球背面藏了啥?中国科学家发现超级材料,改变人类太空探索未来_样品_技术_嫦娥
- 想买的赶快!消息称今年安卓手机整体涨幅20% 高端机涨超1000元_存储_连中框_nm
- 特斯拉的销量已经不重要了_市场_同比_马斯克




