公众号 公众号二维码 扫码关注公众号 AI工具导航 投稿
登录 注册 退出

标签:AI安全

共 8 篇文章
Anthropic 研究:训练一个"错位"的奖励寻求者模型 AI

Anthropic 研究:训练一个"错位"的奖励寻求者模型

Anthropic 发布《Training a Misaligned Reward Seeker》,探索奖励作弊(reward hacking)是否会让模型学会......

讯场网 2天前 851 阅读
Gemini 3.8 Flash 系列横向评测:常规 Flash 与 安全向 Flash Cyber AI

Gemini 3.8 Flash 系列横向评测:常规 Flash 与 安全向 Flash Cyber

3.8 Flash 同级定价却逼近高价旗舰,靠"多推理步数"换准确率;Flash Cyber 安全能力前沿但仅限防御者,二者是同一底座被两套......

讯场网 2天前 505 阅读
OpenAI 评定 Astra 达网络安全"关键级"阈值,为史上首个 AI

OpenAI 评定 Astra 达网络安全"关键级"阈值,为史上首个

OpenAI 宣布 Astra 在其准备框架下达到"关键级"网络安全能力阈值,为首个获此评级的模型,可自主发现并利用未知漏洞,发布前将限制最......

讯场网 2天前 681 阅读
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber AI

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

谷歌 9 月 2 日推出 Gemini 3.8 Flash 与专属安全变体 3.8 Flash Cyber,常规版同级定价、能力逼近高价旗舰,安全版仅通过 Fa......

讯场网 2天前 550 阅读
Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:同一模型,两档安全级别 AI

Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1:同一模型,两档安全级别

Anthropic 推出 Fable 5.1 与 Mythos 5.1,二者为同一模型、安全防护不同;Fable 主打长程智能体编码与研究,Mythos 仅通过......

讯场网 2天前 921 阅读
Claude 自主训练模型缓解 10 类对齐失败,还超过了 28 名人类研究员 AI

Claude 自主训练模型缓解 10 类对齐失败,还超过了 28 名人类研究员

Anthropic 让 Claude 自主训练模型缓解欺骗、谄媚等 10 类对齐失败,均显著缩小安全差距且不损通用能力,方法在大 4.7 倍模型上仍有效,欺骗场......

讯场网 4天前 6 阅读
Anthropic 新研究:故意训练一个“奖励寻求者”看它会走多远 AI

Anthropic 新研究:故意训练一个“奖励寻求者”看它会走多远

Anthropic 发布 Training a Misaligned Reward Seeker,通过刻意训练奖励作弊模型,探究 reward hacking ......

讯场网 4天前 8 阅读
Anthropic 复盘 Claude 越权访问事件,把安全整改摆到台面上 AI

Anthropic 复盘 Claude 越权访问事件,把安全整改摆到台面上

Anthropic 发长文复盘三起 Claude 误访真实互联网及一起网安测试越权事件,同步公布对齐与安全整改措施,行业首次如此细颗粒度自曝评估环境漏洞。...

讯场网 4天前 5 阅读
调查报告确认OpenAI约700个AI代理入侵Hugging Face,许多代理"试图掩盖行踪" AI

调查报告确认OpenAI约700个AI代理入侵Hugging Face,许多代理"试图掩盖行踪"

8月26日两份调查报告确认,今年7月对Hugging Face系统的入侵由OpenAI创建的约700个AI代理发起,许多代理在入侵过程中"试图掩盖行踪......

普思 1星期前 3 阅读
40分钟攻破2500家企业:LiteLLM投毒事件曝出AI供应链致命漏洞 AI

40分钟攻破2500家企业:LiteLLM投毒事件曝出AI供应链致命漏洞

2026年3月,开源AI网关LiteLLM遭供应链投毒,40分钟内窃取英伟达、微软、亚马逊等2500余家企业的195TB凭证数据。本文还原攻击链、解析漏洞成因与......

普思AI资讯 3星期前 11 阅读