Vera Rubin能效暴涨30倍,AI代理正重塑API经济(科技早报)

今日要点

  • NVIDIA公布Vera Rubin NVL72系统测量数据,每兆瓦吞吐量较GB300 NVL72高出30倍,token成本低35倍 [1]Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Stan
    blogs.nvidia.com
  • MIT学者指出AI代理已成为增长最快的API消费者类别,代理经济的商业机会在于构建市场、协议和服务 [2]AI Agents Become the API Economy’s Biggest New Customers
    pymnts.com
  • Forbes专栏认为AI代理并非创造新网络安全威胁,而是以机器速度暴露组织积累的技术债务和访问控制缺陷 [3]AI Agents Aren't Creating Security Problems. They're Revealing Them.
    forbes.com
  • Complexity Science Hub发布新基准测试,揭示22个大语言模型在”谁是专家”问题上存在偏见 [8]Who does AI consider an expert? New benchmark shows bias across 22 LLMs
    techxplore.com
  • Meta计划8月底或9月初推出代号Hatch的OpenClaw版本,10月推出最新AI模型Watermelon [12]Docs: Meta plans to launch its version of OpenClaw, codenamed Hatch, in late Aug
    Techmeme

算力效率的下一跳:Vera Rubin的30倍跃升

昨日简报中,OpenAI按下前沿模型训练的暂停键,Anthropic揭示多智能体系统中的”思想病毒”传播机制——整个行业的注意力集中在AI能力的风险边界上。今日,NVIDIA则从硬件效率的角度给出了另一面的叙事:算力基础设施的能效正在经历一次量级跃升。

据NVIDIA官方博客公布的数据,Vera Rubin NVL72系统每兆瓦吞吐量比当前一代GB300 NVL72高出30倍,token成本低35倍 [1]Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Stan
blogs.nvidia.com
。这些数据由NVIDIA使用真实世界的代理编码轨迹测量得出 [1]Up to 30x More Work Per Watt: NVIDIA Vera Rubin NVL72 Sets a New Efficiency Stan
blogs.nvidia.com
。需要指出的是,这组数据来自NVIDIA自身,带有产品宣传属性——但即便打折理解,30倍的能效差距也意味着AI推理的边际成本曲线可能正在被重新定义。如果前沿模型的训练因为安全考量而放缓,那么现有模型的推理效率提升就变得更加关键:同样的算力预算能产出更多token,代理应用的规模化门槛随之降低。

代理经济的两条线索:API消费爆发与安全债务暴露

昨日简报记录了Stripe同意收购OpenRouter——一个跨数十个提供商路由数百个模型的网关,被评价为具有重要战略意义。那条消息指向的是代理经济的”管道层”,今日的两条报道则分别从需求侧和安全侧补全了这幅图景。

据PYMNTS报道,AI代理目前是增长最快的API消费者类别 [2]AI Agents Become the API Economy’s Biggest New Customers
pymnts.com
。MIT Media Lab副教授Ramesh Raskar进一步提出,代理经济的商业机会不在于单个代理的能力,而在于构建市场、协议和服务 [2]AI Agents Become the API Economy’s Biggest New Customers
pymnts.com
。这与昨日Stripe收购OpenRouter的逻辑形成呼应:当代理成为API的主要调用者,围绕代理之间的交易、路由和协议的基础设施就成了新的价值高地。

但代理经济的扩张也带来了安全层面的拷问。Forbes专栏作者Larry English提出了一个与主流叙事不同的判断:AI代理不会创造新的网络安全威胁,而是暴露组织现有的治理和访问控制缺陷 [3]AI Agents Aren't Creating Security Problems. They're Revealing Them.
forbes.com
。他的核心论点是,AI代理能以机器速度利用组织多年来积累的技术债务和捷径 [3]AI Agents Aren't Creating Security Problems. They're Revealing Them.
forbes.com
——换句话说,代理不是制造了新问题,而是把原本被人类操作速度掩盖的旧问题放大了。

这个判断与昨日Anthropic的”思想病毒”研究形成了一种互补关系。昨日关注的是代理之间”传播什么”,今日English关注的是代理”利用什么”——前者是思想层面的自传播风险,后者是基础设施层面的既有漏洞被加速利用。两者共同指向一个结论:多智能体系统的安全性挑战,根源往往不在AI本身,而在它所接入的那个并不完美的现实世界。

AI的”专家偏见”与生物医学写作的AI指纹

在代理经济的基础设施讨论之外,今日还有两项研究从不同角度审视了AI系统的可靠性问题。

Complexity Science Hub发布了一项新基准测试,专门研究”AI认为谁是专家”的问题——结果显示22个大语言模型在这一维度上存在偏见 [8]Who does AI consider an expert? New benchmark shows bias across 22 LLMs
techxplore.com
。这项测试的核心不在于模型回答对错与否,而在于模型在判断”谁有资格发言”时是否系统性地偏向某些群体或立场。当AI代理越来越多地被用于信息检索、决策辅助甚至自动执行任务时,这种”专家偏见”可能以隐蔽的方式影响输出结果。

另一项来自phys.org的报道则追踪了AI在学术写作中的渗透。报道称,ChatGPT发布后AI辅助生物医学写作急剧增加,AI词汇指纹已出现在多达十分之九的生物医学文章中 [10]Marker words suggest sharp rise in AI-assisted biomedical writing after ChatGPT
phys.org
。这个比例意味着AI辅助写作在生物医学领域已从边缘现象变成主流实践——但报道本身对此持客观描述态度,并未给出价值判断。值得思考的是,当AI生成的文本成为学术文献的重要组成部分,而AI系统本身又存在”专家偏见”,这两条线索之间是否存在某种隐性的反馈循环:AI辅助写作塑造文献面貌,AI检索又以有偏见的方式解读这些文献。

AI心理治疗的边界:能对话,但难以持续

从学术写作转向临床应用,今日还有一项关于AI聊天机器人心理治疗能力的研究值得关注。

该研究发表于期刊《Computers in Human Behavior: Artificial Humans》,发现AI聊天机器人可以进行基础治疗性对话,但在持续应用特定治疗技术方面存在困难 [7]Psychology researchers scored an AI chatbot's therapy sessions with the same sca
psypost.org
。研究还指出,某语言模型在高质量研究环境中的表现与人类从业者相似,但其适应个体需求调整专门心理方法的能力仍不稳定 [7]Psychology researchers scored an AI chatbot's therapy sessions with the same sca
psypost.org

这一发现可以放在更大的公共卫生背景下理解:全球数亿人患心理健康疾病,多数因成本和地理距离无法获得专业护理 [7]Psychology researchers scored an AI chatbot's therapy sessions with the same sca
psypost.org
。2024年发表于《npj Mental Health Research》的框架已认为LLM有潜力扩大个性化治疗的获取 [7]Psychology researchers scored an AI chatbot's therapy sessions with the same sca
psypost.org
。今日的研究既确认了这种潜力——高质量环境下AI表现可媲美人类——也划出了当前的边界:从”能对话”到”能持续实施特定疗法”之间,仍有尚未跨越的鸿沟。

Meta的AI路线图与Oura的IPO冲刺

最后是两条产业动态。

据Techmeme报道,Meta计划于8月底或9月初推出代号Hatch的OpenClaw版本,并计划于10月推出最新AI模型Watermelon [12]Docs: Meta plans to launch its version of OpenClaw, codenamed Hatch, in late Aug
Techmeme
。Meta的AI产品节奏正在加快——Hatch版本的推出时间窗口距今仅剩数周,而Watermelon模型则定于10月亮相。这意味着今年秋季可能成为AI产品密集发布的时段。

另一边,智能戒指制造商Oura计划最快于9月在美IPO,筹资最高30亿美元,估值超过160亿美元 [11]Oura is reportedly eyeing a September IPO that could value it at more than $16B
TechCrunch
。Oura目前员工超900人,去年9月E轮融资8.75亿美元时估值为109亿美元——不到一年时间估值增长近50% [11]Oura is reportedly eyeing a September IPO that could value it at more than $16B
TechCrunch
。可穿戴健康设备赛道竞争激烈:三星两年前推出Galaxy Ring,Whoop今年3月估值已达100亿美元 [11]Oura is reportedly eyeing a September IPO that could value it at more than $16B
TechCrunch
。值得注意的是,上周旧金山对Oura提起了集体诉讼,指控其误导消费者 [11]Oura is reportedly eyeing a September IPO that could value it at more than $16B
TechCrunch
——IPO前夕的法律风险为这桩上市增添了不确定性。

Oura的IPO与昨日简报中Shein定于9月1日登陆港交所的消息几乎同期——9月可能同时迎来两桩规模可观的上市事件,分别代表算法驱动电商和健康可穿戴硬件两种截然不同的商业模式接受公开市场检验。

封面图来源:blogs.nvidia.com


免责声明:本文仅对公开资讯进行收集与整理,不构成任何投资或技术选型建议,亦不代表对相关技术或产品走势的预测。

感谢阅读!如有疑问请留言
上一篇
下一篇