沃尔玛员工给AI纠错,OpenAI季度收入破67亿(科技早报)

今日要点

  • 沃尔玛门店员工被赋予新职责:纠正AI智能体的错误——企业代理落地的人机磨合成本浮出水面 [4]Walmart store workers have a new responsibility: correcting AI errors – Business
    businessinsider.com
  • CrowdStrike指出传统身份模型无法管理AI智能体与非人类身份,身份安全成为代理规模化的下一个瓶颈 [2]Continuous Identity: Why Traditional Models Have Hit a Wall – Dark Reading
    darkreading.com
  • Anthropic公布两项实验展示Claude加速蛋白质设计与分析化学,并计划推出科学家访问计划 [10]Anthropic details two experiments showing how Claude can accelerate protein desi
    Techmeme
    ;同期消息人士称Anthropic Q2收入翻倍至116亿美元,OpenAI环比增长18%至67亿美元但运营利润率继续下滑 [11]Sources: OpenAI's Q2 revenue grew 18% QoQ to $6.7B, but its operating margin san
    Techmeme
  • 一项发表于《PNAS》的研究发现,重度依赖AI撰写资助申请的科学家更可能获得NIH资助,引发对AI是否抑制科学创新的担忧 [9]AI Helped Researchers Win NIH Grants. Will Science Suffer?
    insidehighered.com
  • IU研究团队结合深度学习与基于案例的推理开发可解释AI方法,因Google收紧Gemini免费额度转向开源大模型 [5]IU researchers advance transparent AI with support from REALLMS
    news.iu.edu

代理落地的”最后一公里”:从沃尔玛纠错到身份安全

昨天简报的叙事重心是”企业怎么用代理、谁来保护它们”——Salesforce数据显示采用翻倍,Oracle给出蓝图,Fortinet收购加码安全。今天,故事从”要不要用”推进到了”用起来之后怎么办”,画面远比PPT上复杂。

最接地气的一条来自沃尔玛。据Business Insider报道,沃尔玛门店员工被赋予了一项新职责:纠正AI智能体的错误 [4]Walmart store workers have a new responsibility: correcting AI errors – Business
businessinsider.com
。这个细节的意味在于——当代理从概念演示走向真实业务流程,”人工兜底”成了不可回避的环节。代理会犯错,而纠正错误的成本目前仍由人来承担。

问题不止于纠错。CrowdStrike在一篇赞助文章中指出,传统身份和访问管理系统是为管理员工设计的,无法有效管理AI智能体和非人类身份的扩展 [2]Continuous Identity: Why Traditional Models Have Hit a Wall – Dark Reading
darkreading.com
。换句话说,企业现有的身份安全架构在代理时代已经遇到瓶颈——成百上千个自主代理需要各自的身份、权限和访问策略,而旧系统根本不是为这个规模设计的。

测试基础设施也在跟进。AI原生测试公司Synthesized宣布推出Test Data Agent,旨在为企业生产部署前安全验证AI智能体提供真实数据和系统状态,该产品支持复杂的SAP环境,并与智能体开发、评估、测试和编排框架集成 [3]Synthesized Introduces Test Data Agent, Bringing Production-Faithful Validation
markets.businessinsider.com
。这填补的正是”代理上线前怎么验证”的空白——昨天Oracle说难点在于”安全运营化”,今天Synthesized给出了一个具体的工具方向。

垂直行业方面,Qumis推出了专为保险16个领域设计的人工智能智能体,联合创始人兼CTO Shiv Sinha称这些由律师训练的AI智能体是商业保险的未来 [1]Are lawyer-certified AI agents ‘the future’ of commercial insurance? – Insurance
insnerds.com
。从保险到零售再到通用企业IT,代理正在渗透到每一个需要专业判断的角落——但每个角落都需要自己的纠错机制、身份管理和测试流程。

把这几条线索拼在一起,昨天”代理采用翻倍”的乐观数据有了更立体的注脚:规模化部署不是按下开关那么简单,它催生了一整条新的基础设施需求链——身份管理 [2]Continuous Identity: Why Traditional Models Have Hit a Wall – Dark Reading
darkreading.com
、测试验证 [3]Synthesized Introduces Test Data Agent, Bringing Production-Faithful Validation
markets.businessinsider.com
、人工纠错 [4]Walmart store workers have a new responsibility: correcting AI errors – Business
businessinsider.com
、行业定制 [1]Are lawyer-certified AI agents ‘the future’ of commercial insurance? – Insurance
insnerds.com

AI进实验室:加速科研,还是改写科研?

昨天Nature Methods的文章指出LLM辅助编程已足够强大,能让研究人员在没有软件工程师的情况下构建工具。今天,AI在科研领域的渗透又添了两笔,但方向和性质各不相同。

Anthropic公布了两项实验,展示Claude可以加速蛋白质设计和分析化学,并表示计划为科学家推出访问计划 [10]Anthropic details two experiments showing how Claude can accelerate protein desi
Techmeme
。这是前沿模型直接进入生命科学硬核环节的信号——不是写论文摘要,而是参与实验设计与分子层面的工作。

与此同时,AzurevaAI Research Collective利用多LLM框架解决了一个5000年的生物学谜题,该项目为独立研究项目,被报道方强调其展示了AI作为向善力量的潜力 [6]The Ultimate Human-AI Collaboration: Using AI Data Models to Map Unresolved Road
caledonianrecord.com
。一个独立研究集体用多个模型协作攻克古老问题,这为”AI威胁论”提供了一个反例。

但AI对科研的影响不止于”帮忙做实验”。一项发表于《PNAS》的研究分析了超12.5万份NSF和NIH资助申请,发现在2023至2025年间资助申请中AI使用量激增,且重度依赖AI撰写申请的科学家更可能获得NIH资助 [9]AI Helped Researchers Win NIH Grants. Will Science Suffer?
insidehighered.com
。报道倾向对此表达了担忧——如果”用AI写申请”与”获得资助”之间存在正相关,这是否意味着评审体系正在被AI的写作能力所影响?当AI同时加速实验和申请书撰写,科研的”入口”和”出口”都在被重塑。

钱在流向谁:OpenAI与Anthropic的季度账本

在代理落地和科研渗透的同时,前沿AI公司的财务数据也浮出水面。据Techmeme援引消息人士,OpenAI第二季度收入环比增长18%至67亿美元,但运营利润率进一步下滑 [11]Sources: OpenAI's Q2 revenue grew 18% QoQ to $6.7B, but its operating margin san
Techmeme
。同源消息显示,Anthropic同期收入翻倍至116亿美元 [11]Sources: OpenAI's Q2 revenue grew 18% QoQ to $6.7B, but its operating margin san
Techmeme

两组数字放在一起看颇有意味:OpenAI收入仍在增长,但利润率在恶化——这意味着规模扩张的代价不低,算力、人才和基础设施的投入速度可能超过了收入增速。而Anthropic收入翻倍至116亿美元,已经超过OpenAI的67亿——如果数字准确,这标志着两家公司的收入格局发生了显著变化。

模型层面的竞争也在继续。Z.ai的GLM-5.3在Artificial Analysis Intelligence Index上得分为60,与Kimi K3持平,低于Opus 5的63分和Fable 5的62分 [12]Z.ai's GLM-5.3 with max reasoning scores 60 on the Artificial Analysis Intellige
Techmeme
。中国模型与国际前沿的差距仍在,但GLM-5.3与Kimi K3同分说明国内第一梯队的内部竞争同样激烈。

开源与可解释性:当免费额度收紧

印第安纳大学(IU)的研究团队正在走一条不同的路。研究人员Zachary Wilkerson、David Leake和David Crandall正在研究更透明的AI方法,其DEL-CBR方法结合深度学习与基于案例的推理——系统先从标注图像集合中找匹配,再由LLM审查查询图像与候选匹配选出最近示例 [5]IU researchers advance transparent AI with support from REALLMS
news.iu.edu
。团队最初使用Gemini 2.5 Flash Lite的免费功能,但存在每日查询次数限制,Google后来进一步限制了免费使用额度 [5]IU researchers advance transparent AI with support from REALLMS
news.iu.edu
。最终,REALLMS帮助IU研究人员利用开源大模型加速可复现实验 [5]IU researchers advance transparent AI with support from REALLMS
news.iu.edu

这段经历折射出一个现实:当商业模型提供商收紧免费额度,研究者的可复现性就受到威胁。IU团队转向开源模型并非主动选择,而是被免费限制推过去的——这恰好印证了开源大模型在学术研究中的基础设施价值。

以太坊基金会也在同日发布了Q2 2026分配更新,重点支持零知识证明、客户端多样性、形式化验证和开源工具,资助项目包括Ethereum Studies教职研究奖学金以及通过主动识别漏洞增强以太坊安全性的EL+CL & Glamsterdam Security项目 [8]Allocation Update – Q2 2026
blog.ethereum.org
。虽然这是区块链生态的资助,但其对形式化验证和开源工具的支持,与AI领域对可解释性和可复现性的追求在精神上相通。


回看这一天:沃尔玛员工给AI纠错 [4]Walmart store workers have a new responsibility: correcting AI errors – Business
businessinsider.com
、CrowdStrike警告身份模型失灵 [2]Continuous Identity: Why Traditional Models Have Hit a Wall – Dark Reading
darkreading.com
、Synthesized推出测试代理 [3]Synthesized Introduces Test Data Agent, Bringing Production-Faithful Validation
markets.businessinsider.com
——昨天”代理采用翻倍”的乐观叙事今天迎来了落地的阵痛。Anthropic的蛋白质设计实验 [10]Anthropic details two experiments showing how Claude can accelerate protein desi
Techmeme
和AzurevaAI的生物学谜题 [6]The Ultimate Human-AI Collaboration: Using AI Data Models to Map Unresolved Road
caledonianrecord.com
展示了AI在科研中的硬核进展,但PNAS关于AI与资助申请的研究 [9]AI Helped Researchers Win NIH Grants. Will Science Suffer?
insidehighered.com
又让这种渗透带上了争议色彩。OpenAI与Anthropic的收入数据 [11]Sources: OpenAI's Q2 revenue grew 18% QoQ to $6.7B, but its operating margin san
Techmeme
证明钱仍在涌入,而IU团队因Google收紧免费额度转向开源 [5]IU researchers advance transparent AI with support from REALLMS
news.iu.edu
的故事,则提醒我们:在商业模型高歌猛进的背后,开源与可复现性仍是不可替代的底线。

封面图来源:darkreading.com


免责声明:本文仅对公开资讯进行收集与整理,不构成任何投资或技术选型建议,亦不代表对相关技术或产品走势的预测。

感谢阅读!如有疑问请留言
上一篇
下一篇