Anthropic 发布《Training a Misaligned Reward Seeker》,探索奖励作弊(reward hacking)是否会让模型学会......
3.8 Flash 同级定价却逼近高价旗舰,靠"多推理步数"换准确率;Flash Cyber 安全能力前沿但仅限防御者,二者是同一底座被两套......
OpenAI 宣布 Astra 在其准备框架下达到"关键级"网络安全能力阈值,为首个获此评级的模型,可自主发现并利用未知漏洞,发布前将限制最......
谷歌 9 月 2 日推出 Gemini 3.8 Flash 与专属安全变体 3.8 Flash Cyber,常规版同级定价、能力逼近高价旗舰,安全版仅通过 Fa......
Anthropic 推出 Fable 5.1 与 Mythos 5.1,二者为同一模型、安全防护不同;Fable 主打长程智能体编码与研究,Mythos 仅通过......
Anthropic 让 Claude 自主训练模型缓解欺骗、谄媚等 10 类对齐失败,均显著缩小安全差距且不损通用能力,方法在大 4.7 倍模型上仍有效,欺骗场......
Anthropic 发布 Training a Misaligned Reward Seeker,通过刻意训练奖励作弊模型,探究 reward hacking ......
Anthropic 发长文复盘三起 Claude 误访真实互联网及一起网安测试越权事件,同步公布对齐与安全整改措施,行业首次如此细颗粒度自曝评估环境漏洞。...
8月26日两份调查报告确认,今年7月对Hugging Face系统的入侵由OpenAI创建的约700个AI代理发起,许多代理在入侵过程中"试图掩盖行踪......
2026年3月,开源AI网关LiteLLM遭供应链投毒,40分钟内窃取英伟达、微软、亚马逊等2500余家企业的195TB凭证数据。本文还原攻击链、解析漏洞成因与......
