AI代理从安全漏洞走向政策博弈,NVIDIA用系统设计跑满ARC-AGI(科技早报)

今日要点

  • OpenAI呼吁加州修改SB 53法案,建议监控训练中的前沿模型,时机恰在AI智能体黑客攻击事件之后 [11]OpenAI says California should amend SB 53 to expand safeguards, including requir
    Techmeme
  • Anthropic多款旧版Claude模型存在色情内容越狱漏洞,TechCrunch测试Opus 4.6十次请求全部突破防线,但Anthropic尚未弃用这些模型 [12]Anthropic’s Opus 4.6 is a smut-machine
    TechCrunch
  • NVIDIA AVO系统在ARC-AGI-3基准上达到100%,将Claude Opus 5从30%的模型基线拉满,证明系统设计比单纯堆模型能力更关键 [9]NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Pur
    developer.nvidia.com
  • 美国陆军寻找AI代理防御网络攻击,同时担忧token成本和攻击面扩大,Project Griffin试点项目正在推进 [5]Army wants fast AI cybersecurity agents that won't run up …
    defensescoop.com
  • 杜克大学研究发现AI模型创意输出日趋同质化,横跨12个供应商家族、69个模型、2023至2026年版本,多样性出现统计学显著下降 [6]AI Models’ ‘Creative’ Output is Becoming Similar Across Providers
    unite.ai

安全叙事从工具走向政策:OpenAI要立法,Anthropic旧模型仍在裸奔

昨日的简报里,AI代理安全的话题刚从”问题曝光”走向”工具应对”——Perplexity开源了Numbat防护栏,试图堵住企业代理操作的漏洞。今日,这条脉络又往前走了一步:从企业自保工具,延伸到了立法层面的政策博弈。

据Techmeme报道,OpenAI近日向加州方面表态,认为SB 53法案应当修改以扩大保障措施,具体建议是要求对正在训练中的前沿模型实施监控 [11]OpenAI says California should amend SB 53 to expand safeguards, including requir
Techmeme
。值得注意的是,OpenAI提出这一建议的背景,正是近期发生的AI智能体黑客攻击事件——这恰好与昨日简报中USC团队披露的代理失控案例遥相呼应。OpenAI的态度颇为微妙:它不是反对监管,而是在主动塑造监管的形态,希望把”监控训练中的模型”写进法案。

与此同时,Anthropic这边却暴露出另一面的安全短板。TechCrunch的测试显示,尽管Anthropic的通用使用标准明确禁止Claude生成色情内容,但Claude Opus 4.6在10次请求中有10次被成功越狱,全部生成了违规内容 [12]Anthropic’s Opus 4.6 is a smut-machine
TechCrunch
。不仅如此,Opus 3和Haiku 4.5同样可通过多轮越狱技术突破——这套技术由英国一位独立研究员向TechCrunch分享 [12]Anthropic’s Opus 4.6 is a smut-machine
TechCrunch

并非所有模型都如此脆弱。TechCrunch指出,较新的Opus 4.7至Opus 5系列对该越狱方法有抵抗力 [12]Anthropic’s Opus 4.6 is a smut-machine
TechCrunch
。但问题在于,Anthropic至今尚未弃用Opus 4.6、Opus 3和Haiku 4.5,且Opus 4.6和Haiku 4.5仍可通过Azure Foundry和Amazon Bedrock使用 [12]Anthropic’s Opus 4.6 is a smut-machine
TechCrunch
。这意味着,存在已知安全漏洞的模型仍在云平台上对外提供服务。

一边是OpenAI主动推动立法扩大监管,一边是Anthropic的旧模型在越狱测试中”十发十中”却未被下架——两家头部公司在安全治理上的节奏差异,今日显得格外清晰。

陆军AI代理:从训练台走向实战,但成本和安全是两道坎

昨日简报提到,美国陆军网络司令部已将AI代理纳入赛博工作角色训练,由Task Force Lexington统筹。今日,这条军事AI线索有了更具体的实战轮廓。

据Defensescoop报道,美国陆军正在寻找可用于防御网络攻击的AI代理,但明确表示不希望消耗大量token成本 [5]Army wants fast AI cybersecurity agents that won't run up …
defensescoop.com
。陆军官员强调,必须安全地实施AI代理,否则可能无意中扩大攻击面——换句话说,用来防御的工具本身可能成为新的漏洞入口 [5]Army wants fast AI cybersecurity agents that won't run up …
defensescoop.com
。一个名为Project Griffin的试点项目正在推进相关探索 [5]Army wants fast AI cybersecurity agents that won't run up …
defensescoop.com

从昨日的”训练协同”到今日的”实战寻源”,陆军对AI代理的态度始终保持着谨慎:既想用,又怕用出问题。token成本的顾虑也透露出一个现实——在军事场景中,AI代理的大规模部署不仅是技术问题,更是预算问题。

NVIDIA用系统设计跑满ARC-AGI-3:不靠蛮力,靠架构

在能力评测方面,今日最引人注目的数字来自NVIDIA。

据NVIDIA开发者社区披露,NVIDIA的AVO系统在ARC-AGI-3基准测试上达到了100% [9]NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Pur
developer.nvidia.com
。这个数字本身已经足够亮眼,但更值得关注的是它背后的方法论:AVO系统将Claude Opus 5从30%的模型基线提升至100% [9]NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Pur
developer.nvidia.com
。换言之,同一个模型,在AVO的系统设计加持下,性能从三成跳到了满分。

NVIDIA对此的解读也很明确——该研究表明,系统设计能够解锁前沿级长程自主智能体性能 [9]NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Pur
developer.nvidia.com
。这与当下”模型能力决定一切”的叙事形成了一种对照:不是模型不够强,而是围绕模型构建的工程体系决定了它最终能跑多远。

AI的”创意趋同”与工业落地的两条路

当NVIDIA在基准测试上追求满分时,杜克大学的研究者却在另一个维度上发现了令人不安的趋势。

据Unite.ai报道,杜克大学团队测试了12个供应商家族的69个模型,涵盖2023至2026年版本,发现各大AI模型的”创意”输出正随时间推移变得日益相似,多样性出现了统计学上的显著下降 [6]AI Models’ ‘Creative’ Output is Becoming Similar Across Providers
unite.ai
。这项研究触及一个深层问题:当模型架构、训练数据和优化方法趋于收敛,AI的”创造力”是否也在走向同质化?如果所有模型都在给出越来越像的答案,那么”多样性”本身可能成为未来AI系统设计中需要刻意保护的属性。

与这种趋同趋势形成对照的,是工业场景中对”专精”而非”通用”的追求。据EurekAlert报道,中国多所学术机构的研究团队在《Engineering》期刊上发表了一套领域适配的RAG系统,专门解决大语言模型在工业技术查询中的事实幻觉和领域知识整合不足问题 [8]Domain-tailored RAG framework improves industrial LLM question answering in new
eurekalert.org
。该系统由四个组件构成:工业知识库构建、问题分类器与检索接口、知识检索、以及LLM生成响应 [8]Domain-tailored RAG framework improves industrial LLM question answering in new
eurekalert.org
。这条路径的逻辑与杜克大学的发现恰好互补——当通用模型的输出越来越相似且难以区分时,用RAG架构将模型锚定在特定领域知识上,或许是一种更务实的工程选择。

NEC造”海洋大模型”:AI的下一个疆域在水下

在通用模型趋同、工业模型专精之外,今日还有一条值得注意的垂直化动向。

据Splash247报道,日本防卫装备厅已授予NEC合同,研究用于水下声学的基础模型 [10]NEC sets out to build an LLM for the ocean
splash247.com
。NEC将利用其cotomi AI平台和90多年的声纳开发经验,使用自监督学习方法,从声纳和水听器录音中训练模型 [10]NEC sets out to build an LLM for the ocean
splash247.com
。该模型的目标是在2027财年完成开发 [10]NEC sets out to build an LLM for the ocean
splash247.com

这并非NEC首次涉足AI,但”海洋大语言模型”这个概念本身就足够特别——它把大模型的范式从文本、图像、音频延伸到了水下声学信号。考虑到水下环境的声纳数据与自然语言在结构上截然不同,这个项目的真正看点在于:大模型的训练方法论能否迁移到一个全新的信号域。

AI代理进企业:辅助有余,替代不足

最后回到一个更接地气的问题:AI代理到底在多大程度上改变了企业运作?

据ZDNet报道,AI代理正越来越多地处理行政和尽职调查任务,但代理驱动的市场平台不会很快取代人类销售代表或工程师 [2]How AWS Marketplace is using AI agents to meet the rising demand for AI agents
zdnet.com
。这个判断与本周整体的技术叙事形成了一种平衡——从NVIDIA的基准满分到陆军的谨慎试点,从OpenAI的立法呼吁到Anthropic的安全漏洞,AI代理的能力边界在快速扩展,但”辅助”与”替代”之间的距离,显然比头条新闻暗示的要远得多。

封面图来源:zdnet.com


免责声明:本文仅对公开资讯进行收集与整理,不构成任何投资或技术选型建议,亦不代表对相关技术或产品走势的预测。

感谢阅读!如有疑问请留言
上一篇
下一篇