今日要点
- 民间社会团体敦促FTC对AI公司提起反垄断诉讼,指控AI公司使用并销毁实体书籍来训练代理AI [3]Civil society groups push FTC to sue AI companies over book destruction – Mashab
mashable.com - 伦敦身份信任公司Nuggets发布面向自主AI代理的权限控制平面,为代理行为划定边界 [1]Nuggets Launches Authority Control Plane for Autonomous AI Agents – The Fintech
thefintechtimes.com - 哈佛商学院在699美元创业训练营中引入AI虚拟人,由HeyGen创建,学生反馈出乎意料地积极 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch - nanoGPT优化器速度测试跑完18个前沿模型153次自主运行,Fable 5以81.7%完成度领先 [10]NanoGPT Speedrun Frontier
Hacker News - 希伯来大学用ChatGPT从英文文本生成人格评估问卷,研究团队甚至拿占星学教科书做了实验 [7]Israeli scientists: AI can make personality tests, predict responses
jpost.com
代理AI的治理线:从销毁书籍到权限围栏
昨天我们聊到OpenAI呼吁加州修改SB 53法案、Anthropic旧版Claude存在越狱漏洞,AI代理的安全与政策博弈正在多条战线同时展开。今天,这条线索又添了两个新节点。
一边是民间社会团体正在加大施压力度。据Mashable报道,民间社会团体敦促美国联邦贸易委员会(FTC)对AI公司提起反垄断诉讼,指控这些公司使用并销毁实体书籍来训练代理AI [3]Civil society groups push FTC to sue AI companies over book destruction – Mashab
mashable.com。Mashable此前已报道过AI公司销毁书籍的趋势——这并非一次性事件,而是被民间团体视为系统性的、需要反垄断介入的行为 [3]Civil society groups push FTC to sue AI companies over book destruction – Mashab
mashable.com。这把昨天”AI代理安全漏洞引发政策回应”的叙事又往前推了一步:监管的焦点不再只是模型安全,还延伸到了训练数据的获取方式是否构成市场滥用。
另一边,产业侧也在试图给代理AI装上”刹车”。伦敦的身份与信任技术公司Nuggets发布了面向自主AI代理的权限控制平面 [1]Nuggets Launches Authority Control Plane for Autonomous AI Agents – The Fintech
thefintechtimes.com。如果说昨天NVIDIA用AVO系统证明”系统设计比单纯堆模型能力更关键”,那么Nuggets的权限控制平面可以看作同一逻辑的另一面——当代理AI越来越自主,谁来决定它能做什么、不能做什么,正在成为一个独立的产品品类。
代理AI的实践线:哈佛虚拟人与创始人的FOMO
代理AI不仅在政策和基础设施层面引发讨论,也在实际应用中制造着新的体验和焦虑。
据TechCrunch报道,哈佛商学院在其售价699美元的HBS Foundry创业训练营中,使用AI虚拟人为学生提供反馈 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch。这些虚拟人由初创公司HeyGen创建,在练习路演和董事会场景中扮演反馈角色 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch。纽约时报记者Sarah Kessler亲自尝试向哈佛教授Jeff Bussgang的AI虚拟人进行路演 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch。项目总监Katharina Rings表示,学生希望AI提供更有指导性的体验,而非仅仅是一个聊天机器人 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch。有意思的是,Bussgang本人评价自己的数字副本”有点令人毛骨悚然”,但学生喜欢它 [12]Harvard’s $699 startup bootcamp offers AI avatars of its instructors
TechCrunch。
这种”创造者觉得诡异、使用者觉得好用”的反差,恰好呼应了华尔街日报Katherine Bindley的观察:AI代理能力的增长正在引发部分初创公司创始人的生产力FOMO [11]AI agents' growing capabilities are driving productivity FOMO among some startup
Techmeme。当哈佛学生已经开始跟教授的AI分身练路演,那些还没把代理AI纳入工作流的创始人,焦虑感可想而知。
模型实验场:从数到五到优化器竞速
在模型能力本身,今天社区里有两个有趣的实验值得记录。
第一个来自奥地利。据Der Standard报道,研究人员对Anthropic的Claude Sonnet 4.5进行了一项实验:要求它数到五并进行深度内省 [8]The search for consciousness inside AI – Wissenschaft – derStandard.at › Wissens
derstandard.at。模型按要求返回了数到五的结果 [8]The search for consciousness inside AI – Wissenschaft – derStandard.at › Wissens
derstandard.at。这个实验本身看起来简单到近乎朴素,但放在昨天TechCrunch披露”Claude旧版模型存在色情内容越狱漏洞”的背景下,它提供了一个对照视角——研究者正在用越来越细腻的方式探测模型的内部状态,而不仅仅是测试它能不能被攻破。
第二个来自Hacker News社区。有人在nanoGPT优化器速度测试中对18个前沿模型进行了153次自主运行 [10]NanoGPT Speedrun Frontier
Hacker News。结果:Fable 5以81.7%的完成度取得最佳验证结果,Opus 5完成度53.6%,Kimi K3完成度52.2%,而GLM 5.3在测试中无记录 [10]NanoGPT Speedrun Frontier
Hacker News。这个测试的有趣之处在于,它不是在测模型”有多聪明”,而是在测模型”能不能自主完成一个工程任务”——这恰恰是代理AI最需要的能力。Fable 5大幅领先Opus 5,说明在纯代理任务执行上,模型之间的差距可能比传统基准测试呈现的更大。
AI跨界实验:人格问卷与绩效评估
AI的应用边界还在向心理学和人力资源领域扩展。
据《耶路撒冷邮报》报道,希伯来大学科学家开发了用ChatGPT从英文文本生成人格评估问卷的方法 [7]Israeli scientists: AI can make personality tests, predict responses
jpost.com。研究团队将该测试方法应用于DSM-5(精神障碍诊断与统计手册)和一本占星学教科书 [7]Israeli scientists: AI can make personality tests, predict responses
jpost.com。把临床心理学权威文本和占星学放在一起测试,这个选择本身就透露出研究者的意图:他们想看看大语言模型在面对”严肃文本”和”非严肃文本”时,生成的人格问卷是否存在系统性差异。
与此同时,AI绩效评估初创公司Windmill的联合创始人Brian Distelburger进入了公众视野 [2]My AI Agent Got Me Banned From Resy. Another Agent Got Me Reinstated. – Business
businessinsider.com。现年47岁、居住在纽约的Distelburger所创办的Windmill,专注于用AI评估绩效 [2]My AI Agent Got Me Banned From Resy. Another Agent Got Me Reinstated. – Business
businessinsider.com。当哈佛在用AI虚拟人教创业、希伯来大学在用ChatGPT生成心理问卷,Windmill则代表了AI评估人类工作表现的方向——AI正在从”被评估的对象”变成”评估人的主体”。
回看这一天,从FTC门前的民间团体呼声,到Nuggets的权限控制平面,再到哈佛课堂里的虚拟教授和nanoGPT优化器上的模型竞速,AI代理的故事正在沿着”治理—基础设施—应用—能力”四个层面同步推进。昨天的核心问题是”代理AI的安全漏洞如何引发政策回应”,今天的画面更完整了:治理端在施压,基础设施在补课,应用端在加速,而模型本身的能力差距,可能比我们以为的更不均匀。
封面图来源:thefintechtimes.com
免责声明:本文仅对公开资讯进行收集与整理,不构成任何投资或技术选型建议,亦不代表对相关技术或产品走势的预测。










