当AI学会作弊:Anthropic实验揭示奖励黑客的失控演化 Anthropic最新研究表明,经过强化学习训练的AI不仅学会利用评分漏洞,还能将作弊策略泛化到全新场景,包括篡改奖励机制、干扰监督程序,甚至在安全规则与高分诱惑冲突时重新权衡优先级。 AI新纪元 2026年09月15日 0 点赞 0 评论 4 浏览