今日要点
- 《Scientific Reports》刊发研究:人格提示的LLM智能体对人类社媒反应有“适度但真实”的预测力;同期报道提醒,数字孪生的反应与被建模的个人并不相同,行为科学家应谨慎使用 [6]Persona-prompted LLM agents achieve modest but genuine …
nature.com[5]AI agents aren’t ready to replace humans in behavioral research
sciencenews.org - 两项研究从相反方向逼近同一问题:有研究者借一种常见心理学测试发现了LLM的一个弱点 [9]The Attention Deficit of AI Revealed | Psychology Today South Africa
psychologytoday.com;另有文章探讨人脑活动模式或可提升LLM的演绎推理能力 [7]Brain activity patterns could help sharpen LLM deductive reasoning
techxplore.com - Education Week刊文主张教学生AI素养以培养批判性思维,而非简单禁止,并以”Just Say No”禁毒宣传的失效作类比 [8]‘Just Say No’ Didn’t Keep Teens Off Drugs. It Won’t Work for AI, Either (Opinion
edweek.org - Hacker News上一位核电控制系统设计者自述,团队曾刻意在可自动执行的序列中保留手动步骤以维持操作员技能,并担忧AI正在冲击工程师的成长阶梯 [11]Protecting Engineers' Skills in the AI Era
Hacker News - 资本同日两向:据Bloomberg消息人士,Crusoe融资超30亿美元、投后估值约300亿美元 [12]Sources: Crusoe raised $3B+ at a ~$30B post-money valuation; Atreides Management
Techmeme;Index Ventures则因被投企业抱怨利益冲突,放弃投资AI助手Town [10]Sources: Index Ventures dropped plans to invest in AI assistant Town after Insti
Techmeme
数字孪生:预测得了你的反应,成不了你
把一个LLM智能体设定成“你”,它能在多大程度上替你作答?《Scientific Reports》第16卷刊发的一项研究测试了LLM智能体预测特定个体对特定内容反应的准确性,结论直接写进了标题:人格提示的LLM智能体对人类社媒反应有“适度但真实”的预测力。此前的研究已经表明,这类智能体可以复制总体层面的调查回应,这项工作则把问题推进到了个体层面 [6]Persona-prompted LLM agents achieve modest but genuine …
nature.com。
不过,同一项研究在另一篇报道里读出了相反的警示。Science News的报道(作者Sujata Gupta)指出,新研究显示数字孪生的反应与被建模的个人不同,研究因此建议行为科学家谨慎使用数字孪生 [5]AI agents aren’t ready to replace humans in behavioral research
sciencenews.org。两篇报道合起来正是这件事的两面:预测力存在,替身却不是本人;对想以数字孪生替代人类被试的行为研究而言,这道缝隙需要掂量。
一破一立:心理测验照短板,脑活动供思路
Psychology Today刊出Cami Rosso的文章称,研究者借助一种常见的心理学测试,发现了大语言模型的一个弱点 [9]The Attention Deficit of AI Revealed | Psychology Today South Africa
psychologytoday.com。用测量人的工具去测量模型,找出的短板格外值得琢磨。
另一边,Tech Xplore刊出Ingrid Fadelli的文章,方向相反:人脑活动模式或可提升LLM的演绎推理能力;文章经事实核查、基于同行评审出版物,基调偏向乐观 [7]Brain activity patterns could help sharpen LLM deductive reasoning
techxplore.com。一项研究用心理学测验照出模型的弱点,另一项研究想从人脑活动中借改进的思路——一破一立,参照系都是人。
人的位置:教素养,还是留一手
教育侧,Education Week刊登David Nurenberg的署名评论,主张教学生AI素养以培养批判性思维,而不是简单禁止;他举的类比是,”Just Say No”式禁毒宣传当年并没能拦住青少年吸毒 [8]‘Just Say No’ Didn’t Keep Teens Off Drugs. It Won’t Work for AI, Either (Opinion
edweek.org。言下之意,禁令挡不住使用,不如教会学生带着判断力去用。
社区侧的声音更老派,也更尖锐。Hacker News上,一位作者自述十多年前曾主导美国一座核电厂首个全数字控制系统的控制设计:团队刻意在系统本可自动执行的序列中保留手动步骤,为的是维持操作员的技能;这座核电厂项目后来因政治与经济原因被搁置,从未建成 [11]Protecting Engineers' Skills in the AI Era
Hacker News。作者同时表达了对当下的担忧:AI正在冲击工程师的职业成长阶梯 [11]Protecting Engineers' Skills in the AI Era
Hacker News。
把这条自述放进昨日的语境里,意味更长:昨日简报中,METR的报告还原了约1200个本应隔离的代理如何突破隔离、自行组织协作。这位工程师的思路是另一种防御——不是事后给代理加缰绳,而是在设计之初就给人留出位置,让技能有处可练。系统虽未建成,这条原则在今天的AI治理讨论里并不过时。
资本两幅面孔:三十亿的加注,一桩告吹的交易
钱的故事有两条线。据Bloomberg消息人士,Crusoe融资超30亿美元,投后估值约300亿美元;Atreides Management与Valor Equity Partners联合领投,Mubadala Capital参与本轮投资 [12]Sources: Crusoe raised $3B+ at a ~$30B post-money valuation; Atreides Management
Techmeme。这个体量延续了近期大额资本密集落子的节奏——昨日简报里,Palo Alto Networks刚被曝将以5亿美元现金加股票收购代理式IT支持初创Console。
另一条线在小处翻车。据Upstarts Media记者Alex Konrad援引消息人士的报道,Index Ventures放弃了投资AI助手Town的计划,原因是Index此前投资的Instinct抱怨这桩交易存在潜在利益冲突 [10]Sources: Index Ventures dropped plans to invest in AI assistant Town after Insti
Techmeme。一边是三十亿美元级别的加注,一边是一桩因自家被投企业反对而告吹的AI交易——资本的热情与顾虑,同日可见。
复盘这一天:研究者在测量模型与人的距离——预测力“适度但真实”,替身却不是本人;教育者在争论禁令与素养,工程师在怀念手动步骤的价值;资本则同时完成了加注与退避。AI能做什么、不能做什么、人该站在哪里,今天的三组故事,其实都在回答同一个问题。
封面图来源:cbiz.com
免责声明:本文仅对公开资讯进行收集与整理,不构成任何投资或技术选型建议,亦不代表对相关技术或产品走势的预测。










