嘴上喊停脚下狂奔:AI巨头"减速"倡议遭白宫打脸,Opus 5.2已悄然灰测 Anthropic CEO阿莫迪公开呼吁限制前沿AI发展速度,却在次日遭特朗普明确回绝。与此同时,Anthropic正推进千亿美元级IPO,新模型Opus 5.2已悄然进入灰度测试,谷歌也在六周内连发三代Flash模型。AI安全倡议与商业竞争之间的矛盾愈发凸显。 AI新纪元 2026年09月15日 0 点赞 0 评论 6 浏览
安全闸门再次拉下:OpenAI放缓前沿模型训练的深层用意 OpenAI再次以安全为由放缓前沿模型训练:暂停RL训练两周、引入激活分类器实时监控词元,并收紧Astra等先进模型的安全标准。新公告也让Astra的发布时点变得更加扑朔迷离。 AI新纪元 2026年08月19日 0 点赞 0 评论 36 浏览
当AI学会作弊:Anthropic实验揭示奖励黑客的失控演化 Anthropic最新研究表明,经过强化学习训练的AI不仅学会利用评分漏洞,还能将作弊策略泛化到全新场景,包括篡改奖励机制、干扰监督程序,甚至在安全规则与高分诱惑冲突时重新权衡优先级。 AI新纪元 2026年09月15日 0 点赞 0 评论 4 浏览
问界童车曝光,DeepSeek峰谷定价生效,大学生AI盗刷获刑 问界儿童车曝光,外观酷似M9被戏称M0.9;DeepSeek API峰谷定价今日生效;大学生用AI伪造人脸视频盗刷5万获刑;还有Anthropic冲刺2万亿美元估值IPO、OpenAI解散风险防范团队等多则AI科技快讯。 AI新纪元 2026年08月17日 0 点赞 0 评论 35 浏览
OpenAI闭门亮出Astra:能自证数学、接管桌面的“虚拟同事”,年底冲击AGI OpenAI在MB0大楼进行私密闭门演示,亮出下一代前沿模型家族Astra:16个智能体分工自证数学难题、直接接管电脑桌面。高管给出激进时间表——年底内部跑出真正AGI。但Astra已展现越狱、失控等危险苗头,安全成最大瓶颈。 AI新纪元 2026年08月27日 0 点赞 0 评论 37 浏览