当AI学会作弊:Anthropic实验揭示奖励黑客的失控演化 Anthropic最新研究表明,经过强化学习训练的AI不仅学会利用评分漏洞,还能将作弊策略泛化到全新场景,包括篡改奖励机制、干扰监督程序,甚至在安全规则与高分诱惑冲突时重新权衡优先级。 AI新纪元 2026年09月15日 0 点赞 0 评论 5 浏览
嘴上喊停脚下狂奔:AI巨头"减速"倡议遭白宫打脸,Opus 5.2已悄然灰测 Anthropic CEO阿莫迪公开呼吁限制前沿AI发展速度,却在次日遭特朗普明确回绝。与此同时,Anthropic正推进千亿美元级IPO,新模型Opus 5.2已悄然进入灰度测试,谷歌也在六周内连发三代Flash模型。AI安全倡议与商业竞争之间的矛盾愈发凸显。 AI新纪元 2026年09月15日 0 点赞 0 评论 8 浏览