TodayAI

TODAYAI DAILY

AI 日报2026-09-10

Harvey估值升至155亿美元;谷歌130亿欧元扩建芬兰AI基建;苹果推出照片AI篡改检测 | TodayAI日报

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

Less is MoE:按FFN维度裁剪专家,实现更细粒度的MoE压缩

arXiv论文《Less is MoE: Trimming Experts in Domain-Specialist Language Models》指出,混合专家(MoE)模型通过条件计算获得强性能,但参数量大导致部署困难;此前的MoE压缩方法在常识推理之外的通用基准上会灾难性失效。作者将失败原因归结为压缩粒度:重要能力分散在多个专家中,却集中在FFN的稀疏中间维度上。他们采用Fisher重要性识别关键维度,效果优于基于激活值、路由分数和幅度的方案。在Qwen1.5-MoE上,仅移除135万个路由FFN中间维度中的12个,就会使GSM8K准确率崩塌,而事实知识性能基本保持。该结果提示,领域专用模型的压缩需要更细粒度的维度级裁剪,而非简单删减专家。

来源:arXiv cs.CL·原文

OpenAI发布ChatGPT Images 2.5,API新增两个模型ID

OpenAI推出ChatGPT Images 2.5。官方称,其图像生成模型已在ChatGPT Images与API的GPT-Image模型中累计生成超过30亿张图像。新版本重点改进多轮对话中的指令遵循能力,响应速度更快,也更擅长保留参考照片中的主体特征。API侧新增两个模型ID:gpt-image-2.5-sunburst与gpt-image-2.5-flare。开发者Simon Willison根据实测认为,Sunburst更适合对编辑精度要求高的工作流,Flare则适合追求速度的日常高质量图像生成。对开发者而言,这意味着图像编辑类Agent可以在同一代模型内按精度与延迟做取舍,而不必在质量与响应速度之间二选一。

来源:Simon Willison·原文

EXCODER:让LLM为存量代码自动补齐异常处理

arXiv论文提出一项新任务:为已有代码“回填”异常相关代码(ERC),包括throw语句、守卫throw的条件判断以及try/catch块。给定不含ERC的代码和异常行为测试(EBT,例如验证参数为null时方法是否抛出InvalidArgumentException),目标是自动生成缺失的ERC并使测试通过。作者设计并实现了Exception Coder(EXCODER),通过上下文工程帮助大语言模型完成该任务,并集成了静态分析等手段。异常处理代码在大型代码库中手工编写极为繁琐,且往往是测试覆盖的盲区。若该方法在真实仓库中稳定可用,将有助于把异常路径纳入自动化测试与代码生成流程,降低遗留系统补测试与重构的成本。

来源:arXiv cs.CL·原文

MIT科技评论:OpenAI数学争议或成数学研究转折点

MIT Technology Review的The Download栏目讨论了OpenAI最新争议及其对数学未来的意义。OpenAI称其Agent解决了一个重要的数学开放问题,这本应是重大里程碑,但公告被“未充分署名”的指控所掩盖——有研究者认为其AI辅助工作影响了该解法却未获致谢。文章认为,无论指控是否成立,这一事件都可能标志着数学史的转折点:AI模型似乎已成为推进该领域最重要问题不可或缺的工具,但如何界定贡献与署名仍缺乏共识。对科研机构与AI实验室而言,这提出了新的规范问题:当模型参与证明发现时,人类研究者的贡献应如何被记录、引用与评价,将直接影响学术激励与合作方式。

来源:MIT Technology Review AI·原文

WIRED报道:隐身芯片初创公司Kepler称可缓解AI内存短缺

据WIRED报道,一家名为Kepler Computing的隐身初创公司声称,其新的芯片设计思路与一种专有材料,有望缓解当前导致内存价格飙升的供应瓶颈。报道称,该公司认为现有内存供应链的紧张并非单纯产能问题,而是架构与材料层面的限制,因此试图从设计源头绕开传统路径。目前该公司仍处于隐身阶段,具体技术细节、量产时间表与客户名单尚未公开,其说法也尚未经过第三方验证。若该方案成立,可能影响AI算力成本结构与内存厂商的竞争格局;但在缺乏可复现数据前,更应视为一种待验证的技术主张,而非已经落地的产业突破。

来源:WIRED AI·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

苹果推出Reference Image,用于判断iPhone照片是否被AI改过

TechCrunch报道,苹果推出名为“Apple Reference Image”的新功能,帮助用户判断照片是否经过编辑,包括由AI完成的修改。该能力针对的是生成式编辑普及后“照片是否可信”的问题:当修图与AI生成越来越难用肉眼分辨,平台需要给出可验证的参考依据。对用户而言,这提供了判断图片真实性的新入口;对开发者与内容平台而言,则意味着图片溯源、编辑记录与真实性标识可能成为产品标配,相关工具链和审核流程也要相应调整。

来源:TechCrunch AI·原文

英国议员就AI“混乱之夏”密集发声,监管压力升温

据WIRED报道,随着AI智能体出现失控案例、围绕超级智能的担忧扩散,英国议员正就AI可能对人类生存造成危害发出警告,并推动更强监管。报道将这一轮政治反应与“AI混乱之夏”联系起来,涉及智能体AI、Anthropic、OpenAI等话题。对在英国部署智能体产品的公司而言,这意味着合规审查、透明度要求与事故披露义务可能进一步收紧;涉及自主执行、外部工具调用与高风险场景的产品,需要提前准备可审计日志、权限边界与人工接管机制。

来源:WIRED AI·原文

苹果称新款折叠屏手机铰链制造过程使用AI与3D打印

TechCrunch报道,苹果表示其备受关注的折叠屏手机在制造环节使用了AI与3D打印技术,其中铰链部分由AI参与完成。折叠屏的难点长期集中在铰链的精度、耐久与良率,苹果把AI引入制造工艺,说明生成式与优化类AI正在从软件功能走向产线环节。若该做法成立,可能影响折叠设备的成本结构与产能爬坡节奏,也为制造业客户提供参考:AI在工业场景的价值更多体现在工艺参数优化与复杂结构制造,而非单纯的终端功能。

来源:TechCrunch AI·原文

Google Accelerators十年支持2115家初创与机构,覆盖92国

Google官方博客披露,Google Accelerators过去十年持续扶持全球初创企业:自2016年以来已支持2115家初创公司、开发者、研究机构与非政府组织,覆盖92个国家。该文由Google Accelerators全球负责人Kevin O'Toole撰写,属于公司对自身创业扶持计划的阶段性总结。对AI创业者而言,这类项目的实际价值在于云资源、技术指导与渠道网络,而非单纯资金;在模型与算力成本高企的阶段,能否接入大厂生态,往往直接影响早期产品的迭代速度与获客路径。

来源:Google AI Blog·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

hob:为整个 Agent 栈打造的专业工作空间

hob 在 Product Hunt 上线,定位是覆盖整个 Agent 栈的专业工作空间,把多智能体开发、调试与协作集中到一个统一界面。它要解决的问题是:当项目从单个 Agent 扩展到多个 Agent 协同时,提示词、工具调用、上下文与运行日志往往散落在不同脚本和平台中,排查一次失败链路的成本很高。它适合正把 Agent 从 Demo 推向生产的小团队与独立开发者,用来集中管理运行状态和协作流程。Agent 的可观测性与上下文编排,正是当前工程落地的核心瓶颈。

来源:Product Hunt AI·原文

embedflow:无需重嵌入全量语料即可迁移嵌入模型

有开发者在 r/MachineLearning 分享了 embedflow 的思路:升级嵌入模型时,传统做法要用新模型重新嵌入全部文档;若已有 10 亿向量,在 H100 上按每秒 106 篇文档估算,约需 108 天,回填成本极高。该方法是先从旧索引中抽取 K 篇文档,用新模型重排;当 K 足够大时,检索质量可接近原生新模型,难点在于确定 K。作者称已在最多 100 万文档上测试 63 次迁移,Qwen 4B 升 8B 时 K 取 50 即可持平,并支持 Qdrant、pgvector、faiss。

来源:Reddit Machine Learning·原文

LangChain 详解多 Agent 框架中的上下文组织方式

LangChain 博客介绍了 deepagents 中的上下文模式,用于解决多 Agent 协作时的上下文膨胀问题。核心设计是让子 Agent 可以选择分叉主管 Agent 的上下文,或从完全隔离的上下文启动:分叉适合需要继承任务背景与中间结论的场景,隔离则避免无关历史污染子任务、降低 token 消耗。官方称这样能让多 Agent 工作更快、更便宜也更聚焦。对正在搭建 supervisor 加子 Agent 架构的团队来说,这提供了一种可参考的上下文治理思路:按任务边界决定共享还是隔离,而不是默认全量传递。

来源:LangChain Blog·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

电商属性抽取新方法:并行解码让4B小模型达到大模型精度

arXiv 新论文提出两阶段 LLM 流水线,用于电商目录的属性值抽取(AVE)。第一阶段为每个商品类目自动发现一份紧凑且按购买区分度排序的属性 schema,避免传统系统对所有属性一视同仁、产出大量无效字段的问题;第二阶段用微调后的 Qwen3-4B 小模型配合 Hyper-Parallel Decoding(HPD)从目录文本中抽取属性值。结果显示抽取准确率达 85%,与作为教师的基础大模型持平,同时推理成本下降 92%。这说明在结构化信息抽取这类任务上,先做 schema 筛选再做小模型蒸馏,可能比直接调用大模型更划算。

来源:arXiv cs.CL·原文

研究:学术论文里藏着 3200 处披头士歌词引用

一项发表于 PLoS ONE 的研究统计发现,学术论文中至少出现 3200 处对披头士乐队歌名与歌词的引用,作者来自荷兰代尔夫特理工大学等机构。研究者认为,科研人员常在论文标题或正文中埋入流行文化梗,而披头士是被引用最多的乐队,例如把 Long COVID 相关论文标题改成“The lung and winding road”,只改动一个元音。该研究属于科学传播与科学计量学的交叉观察,说明学术写作并非完全严肃,标题玩梗已成为一种可被量化的出版文化现象。对科研工作者而言,这也提示检索文献时标题关键词可能被改写,需要留意非标准表述带来的漏检风险。

来源:Ars Technica·原文

VLM 幻觉检测:双 token 特征加大小模型集成,SHROOM 任务进前八

针对 SHROOM-Visions 2026 字符级 VLM 幻觉检测任务,一篇 arXiv 论文给出小大模型集成方案。做法是把一个 40 亿参数的小型 VLM 微调成逐 token 分类器,只读取自身隐藏状态中的双 token 特征,再在预测阶段与约 4000 亿参数的零样本 VLM 裁判集成;两个组件都接入现成 OCR 结果,以利用图像中可见文字。作者还用大模型生成合成幻觉数据来增加集成多样性,并通过验证集选择特征层、训练数据和 OCR 接地方式。官方提交在隐藏测试集上取得 Cor 0.487、Cor-lbl 0.387,在英文、法文、意大利文和中文赛道分别位列第 6、6、8、7 名。

来源:arXiv cs.CL·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

Harvey估值升至155亿美元,较九个月前的110亿美元上涨约四成

法律AI初创公司Harvey在九个月内把估值从110亿美元推高至155亿美元,成为风投圈最受关注的法律科技标的之一。此轮估值跃升发生在生成式AI向专业服务渗透的窗口期,法律行业因文档密集、合规要求高、付费能力强,被视为AI落地确定性较高的场景。Harvey的客户以大型律所与企业法务部门为主,产品围绕合同审查、尽职调查与法律研究等高频任务展开。估值快速抬升意味着资本市场愿意为垂直AI应用支付溢价,但也对收入增速与续费率提出更高要求。对同类创业者而言,法律AI的竞争焦点正从模型能力转向数据壁垒、工作流嵌入深度与客户信任。

来源:TechCrunch AI·原文

Google宣布在芬兰投资130亿欧元扩建AI基础设施

Google通过官方博客宣布,将在芬兰投入130亿欧元用于AI基础设施建设,涵盖数据中心扩容、数字基础设施升级与清洁能源配套,并强调将带动当地就业、支持环境项目。该消息由Google全球基础设施副总裁Bikash Koley署名发布,属于Google在欧洲长期布局的一部分。芬兰具备寒冷气候、稳定电网与成熟数字产业,适合承载高密度算力负载。此举反映出头部云厂商正把资本开支前置到电力与土地资源更优的区域,以缓解AI训练与推理的能耗约束。对欧洲市场而言,这类投资既带来算力供给,也可能引发对能源分配与数据主权的持续讨论。

来源:Google AI Blog·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

谷歌官方介绍 Gemini 如何辅助报税、缴罚单与社会服务申请

谷歌官方博客发文,介绍用户如何借助 Gemini 处理报税、缴纳罚单、申请社会服务等复杂政务流程,并给出四类典型用法。这类场景的共同点是表单繁琐、术语晦涩、跨部门流程长,恰好适合由模型做信息整理与步骤拆解。值得注意的是,官方口径把 Gemini 定位为行政事务的辅助工具,而非替代专业意见,用户仍需自行核对提交内容。对 AI 产品而言,政务与合规类任务正在成为通用助手的现实落地场景,但准确性、隐私与责任边界仍是决定其能否规模化的关键约束。

来源:Google AI Blog·原文

Elsewise 创作工具:用可能性空间可视化缓解 LLM 互动叙事的作者意图偏移

arXiv 上一项研究提出 Elsewise,一款面向大模型互动叙事的创作工具,核心是引入 Bundled Storyline 概念,把作者预设的叙事可能性空间可视化,让创作者看清玩家实际可能走到的分支。研究指出,生成式 AI 能根据玩家开放式输入即兴扩展剧情,但这种外推会拉大作者设想与玩家体验之间的差距,削弱情节推进力度与作者意图的传达。该工作属于人机交互与 AI 写作的交叉方向,价值在于把可控性作为互动叙事的设计目标,而非单纯追求生成自由度。

来源:arXiv cs.CL·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Aaron Levie(Box CEO):编程 Agent 会带来更多工程师,而不是更少

Levie 认为,编程 Agent 的用途会远超预期:它会催生全新品类的工具,让过去负担不起软件的公司也能自建系统,还能用于抵御网络风险、自动化生命科学研究、处理复杂工作流中的海量数据、升级遗留系统。核心逻辑是:代码成本下降后,人们会用代码做更多事,软件因此变得更有用,工程师的杠杆被大幅放大——结果反而需要更多工程师,而不是更少。

来源:Follow Builders·原文

Guillermo Rauch(Vercel CEO):半年内 8 次降价、16 项模型折扣

Rauch 观察到,仅过去六个月就出现了 8 次价格下调、费用取消和计费结构调整,另有 16 项模型折扣,而且他认为这还没结束。对开发者来说,这意味着推理成本仍在快速下降,模型选型和成本模型需要按季度重估;对做 Agent 与 AI 应用的团队而言,原本因成本被否掉的长链路、高频调用场景可能重新变得可行,定价策略也应留出跟随降价的调整空间。

来源:Follow Builders·原文

Matt Turck(FirstMark 合伙人):投资人也能像创始人一样熬夜

Matt Turck 借美网史上最晚结束的一场比赛打趣:若有人怀疑 VC 能不能像创始人一样熬到半夜,他们昨晚已经展示了足够的韧性。这条内容并非技术判断,但侧面反映了他对创业者工作强度与投资人投入度的看法。对 AI 创业者而言,融资节奏和竞争窗口常常要求团队在非常规时间保持响应,投资人的参与度也会影响早期公司的推进速度。

来源:Follow Builders·原文

Thibault Sottiaux(OpenAI):给新模型起名,是研究团队最欢乐的环节

Thibault Sottiaux 说,他最大的乐趣之一,就是和研究团队一起争论新模型该叫什么名字,研究员给出的方案往往离谱到好笑。这看似玩笑,却点出了模型发布流程里一个真实环节:命名不只是市场部的活,它同时承载版本语义、能力定位和用户预期,内部争论越激烈,说明团队对模型定位越在意。对做 AI 产品和 Agent 的团队来说,命名同样是接口契约的一部分——一旦名字被开发者写进代码和文档,改名的成本远高于发布前多吵几轮。

来源:Follow Builders·原文