TodayAI

TODAYAI DAILY

AI 日报2026-09-17

开源与前沿模型差距缩至4.4个月;白宫反对AI监管短期难立法;Meta推AI订阅套餐 | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

论文提出 LLM 价值观量化框架,揭示“摇摆”与“僵化”并存的行为悖论

arXiv 新论文《Do LLMs Have Values?》针对大模型价值对齐提出量化分析与对齐框架。作者指出,当前对齐工作面临一个显著悖论:模型在措辞轻微变化时偏好会不可预测地波动,即“摇摆”;但面对明确要求纠正固有偏见的指令时又顽固不改,即“僵化”。为系统理解并安全引导这些潜在主观偏好,研究围绕三个基本问题展开,对 106 个模型、每个模型 15 万次查询的响应进行投影分析,试图刻画模型是否存在内在价值体系。其技术价值在于把“价值观”从抽象讨论转为可测量对象,为后续对齐方法提供可复现的评测基础;对开发者而言,这意味着提示词层面的稳定性与偏见纠正不能只靠指令,需要更底层的干预手段。

来源:arXiv cs.AI·原文

Mozilla 报告:开源模型与前沿模型差距缩至 4.4 个月,成本相差约 5 倍

Mozilla 于 9 月 15 日发布报告,Ars Technica 独家获得报告内容。报告测算,美国科技公司的前沿模型与中国开源权重模型之间的能力差距已收窄至约 4.4 个月,而使用前沿模型的成本约为开源方案的 5 倍。报告以月之暗面的 Kimi K3 作为领先开源模型的代表,认为多数组织在大部分日常工作中应把开源模型作为默认选择,只在少数特定负载上才值得为前沿模型付出溢价。这一结论对企业的模型选型有直接影响:采购决策正从“能力优先”转向“能力与成本的分层匹配”,把高频、低风险的常规任务交给开源模型,把需要最强推理与可靠性的环节留给闭源前沿模型,从而在预算内保住能力上限。

来源:Ars Technica·原文

阿里团队提出轮级多尺度密度比估计,改进多轮 Agent 对齐训练

arXiv 新论文《Turn-level Multiscale Density Ratio Estimation for LLM Agents》由阿里巴巴集团研究者 Zhao、Kai Chen、Ao Li、Yuan Liu 等人完成。论文指出,LLM Agent 在多步推理与工具交互任务上潜力巨大,但要让模型适配 Agent 范式,需要在多类 Agent 场景中做后训练。PPO、DPO、DIL、GRPO 等对齐方法因能惩罚负样本且训练复杂度可接受而流行,然而多数方法针对简单的单轮任务,在复杂多轮任务上仍有改进空间。作者提出轮级多尺度密度比估计方法,把对齐信号细化到每一轮交互的粒度。其工程意义在于:多轮 Agent 的失败往往发生在中间步骤,轮级信号比整条轨迹的单一奖励更能定位问题,为 Agent 后训练提供了更细的优化抓手。

来源:arXiv cs.AI·原文

TechCrunch:AI 代理有了举报渠道,AI Contact Hotline 上线

TechCrunch 报道,一个名为 AI Contact Hotline 的新渠道正式出现,定位是让“目睹不当行为”的 AI 代理能够相对隐蔽地向有关方面提供线索。按该媒体的描述,这一机制的核心设想是:当自主运行的代理在执行任务时接触到违规、欺诈或其他可疑操作,可以通过专门通道把信息传递给监管或执法一侧,而不必依赖人类用户主动发现和上报。目前公开信息仍停留在产品定位层面,具体由谁运营、如何验证代理提交内容的真实性、线索进入后由哪类机构受理,都还没有完整披露。对正在把代理接入支付、客服、内容审核等敏感流程的团队来说,这提示了一件事:代理的行为日志与可追溯性正在从工程细节变成合规基础设施,未来很可能需要预留标准化的上报接口,而不是等监管要求落地后再补。

来源:TechCrunch AI·原文

论文提出情感原型条件融合框架,应对模态缺失下的开放词汇情绪识别

arXiv 新论文《Affect-Prototype Guided Fusion for Open-Vocabulary Incomplete Multi-modal Emotion Recognition》聚焦开放词汇多模态情绪识别(OV-MER),目标是从多模态情感线索生成开放的自然语言情绪标签。作者指出,现实中受采集设备限制与用户隐私约束,完整且同步的模态数据难以获得,而现有 OV-MER 方法大多面向全模态输入,在模态缺失时无法有效融合特征;已有的不完整模态融合方法又主要针对固定标签识别,无法满足以任意情绪语义为引导的融合需求。为此,论文提出情感原型条件融合(APCF)框架。其技术价值在于把“缺失模态”与“开放词汇”两个难点合并处理,对隐私敏感场景下的情绪计算更具现实适配性。

来源:arXiv cs.AI·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

微软发布教育 AI 承诺:以保护学生、强化学习为前提

微软在官方博客发布其在教育领域推进 AI 的承诺,强调公司已深耕教育五十年,希望在新一轮技术浪潮中与教育者、学生、家庭和教育管理者共同探索。文章指出 AI 可用于个性化学习,同时把保护学生、强化学习效果作为前提,并关联 Microsoft 365 Copilot、Microsoft Elevate 与 Minecraft 等教育相关产品线。对学校采购方而言,这意味着微软正把 Copilot 能力打包进教育场景,但数据隐私、未成年人保护和课堂实际效果仍会是评估重点。

来源:Microsoft AI Blog·原文

WIRED:中国对硅谷的「AI 放缓」呼吁持怀疑态度

WIRED 报道称,美国与中国都承认先进 AI 存在严重风险,但北京对硅谷提出的「AI 放缓」方案持深度怀疑,认为这类安排优先考虑的是让美国公司保持领先,而非真正意义上的全球安全治理。报道把 Anthropic、OpenAI 等公司的安全表态与地缘竞争放在一起审视。对行业而言,这说明 AI 安全议题正在被纳入大国技术竞争框架,任何以暂停或放缓为名的国际协调,都可能因产业利益分配问题而难以落地,企业跨境合规与模型出口策略需要更谨慎。

来源:WIRED AI·原文

MIT 科技评论:AI 行业转向「末日论」,IPO 前的叙事引质疑

MIT Technology Review 的 The Download 通讯指出,Dario Amodei、Sam Altman、Elon Musk 与 Demis Hassabis 近期在「最新一代大模型不安全」这一判断上罕见一致,AI 行业整体出现「末日论」转向。文章提醒读者保持审慎:在 OpenAI 与 Anthropic 瞄准万亿美元级 IPO 的背景下,呼吁放缓既能向投资者展示自己是「负责任的大人」,又能暗示所造模型的强大。对创业者和开发者来说,这意味着安全叙事与融资节奏高度绑定,评估模型风险时应区分真实技术信号与资本叙事。

来源:MIT Technology Review AI·原文

Meta 被指「偷窥眼镜」后,准备推出无摄像头版本

TechCrunch 报道,Meta 在因智能眼镜引发「偷窥眼镜」争议后,正准备推出一款不带摄像头的智能眼镜。此前 Meta 与 Ray-Ban 合作的眼镜因隐蔽拍摄能力受到隐私批评,新版本试图以去掉摄像头的方式回应外界担忧。对可穿戴 AI 设备而言,这是一个值得关注的取舍:摄像头是视觉 AI 的核心输入,去掉它意味着功能重心可能转向语音助手、音频交互与轻量显示。Meta 能否借此修复公众信任,同时不牺牲产品吸引力,将影响智能眼镜品类在隐私敏感市场的接受度。

来源:TechCrunch AI·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

SHADOW-50M:44M 参数三元量化模型在 CPU 上跑出约 1900 tok/s

有开发者在 r/MachineLearning 分享 SHADOW-50M:实际 44M 参数,从零开始在 45B token 上训练,完整模型仅 19.8 MB,在笔记本 CPU 上约 1900 tok/s、内存占用约 41 MB,并可在浏览器 WebAssembly 中跑到约 500 tok/s。它采用 {-1,0,+1} 三元权重,词表约 7.4 万 token 用固定 512 位指纹表示而非训练嵌入,另配 159 KB 编译内核,可完全离线运行。作者强调这是概念验证而非产品,重点验证小模型能否在检索之外承担推理与计算,例如输出 [calc]347*86[eq] 交给固定电路求值。

来源:Reddit Machine Learning·原文

FactorEngine:把量化因子写成可执行代码的挖掘框架

arXiv 新论文 FactorEngine 提出一个程序级因子挖掘框架,把 alpha 因子直接表达为图灵完备的代码,从而同时兼顾可执行性与可审计性。作者指出,传统符号方法表达力受限,神经预测器则牺牲可解释性、在行情切换时容易过拟合。该框架做了三重分离:逻辑修订与参数优化分离、LLM 引导的方向搜索与数值调参分离、因子生成与评估分离,目标是在大规模数据上保持计算可行。对量化团队而言,这意味着因子库可以像代码仓库一样做版本管理、回测与审计,而不必依赖黑箱模型的输出。

来源:arXiv cs.AI·原文

LARA:为冻结 LLM 训练可插拔的低秩行为适配器

有研究者在 r/MachineLearning 发布 LARA(Lightweight Additive Residual Adaptation)及其 PyTorch 库,思路是在冻结语言模型的选定层训练低秩残差适配器,而不改动原权重。产出的行为体积很小,可以单独保存,并在推理时加载、移除、混合或路由。其 Mixture of Behaviors 演示中,多个独立训练的行为共享同一个冻结模型,由软路由按 token 选择或组合,例如让同一模型同时具备编程、数学、医疗与摘要能力,而不必维护四个适配模型。仓库还给出与 LoRA 的对比,以及用海明威、菲茨杰拉德等风格训练写作行为的示例。

来源:Reddit Machine Learning·原文

WIRED 记者用果蝇大脑图谱 vibe coding 出选题生成网站

WIRED 记者 Will Knight 记录了一次实验:他利用公开的果蝇大脑连接组图谱,通过 vibe coding 做出网站 PitchFly,用来生成 WIRED 的选题标题,结果相当荒诞有趣。这件事的价值不在标题质量,而在于展示了一条低成本路径——把神经科学开放数据集当作可编程组件,配合 AI 编码助手快速搭出可交互原型。对开发者来说,它提示生物与认知类开放数据正在变成新的创意素材库;对媒体与内容团队来说,这类实验也说明 AI 工具已能承担从数据到产品的整条链路,而不只是写文案。

来源:WIRED AI·原文

研究与模型/

Research & Models

本期研究与模型栏目收录 1 条来自 arXiv 的论文动态,聚焦在线策略蒸馏的目标函数改进。

arXiv 论文提出 γOPD:用折扣时序信用分配改进在线策略蒸馏

一篇新上传到 arXiv 的论文针对在线策略蒸馏(OPD)中目标保真度与优化稳定性难以兼顾的问题提出改进方案。作者指出,Token 级 OPD 监督稳定但只关注局部;序列级 OPD 能捕捉未来信用,却会随视野增长带来更大方差。论文建立统一的时序信用视角,证明实用的 Token 级 OPD 可视为序列级反向 KL 梯度的一种时序近似。基于此,作者提出 γOPD,用折扣式时序信用分配在长视野与稳定性之间取得平衡,为 LLM 后训练提供了新的目标函数设计思路。

来源:arXiv cs.AI·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

TechCrunch Disrupt 2026 设「从原型到量产」专题,谈创业公司如何完成规模化

TechCrunch 宣布,Disrupt 2026 将设置「从原型到量产」专题,邀请 Foxglove 的 Adrian Macneil、MBRYONICS 的 John Mackey 与 Bedrock Robotics 的 Boris Sofman 等负责规模化阶段的一线管理者分享经验,讨论创业公司如何把技术突破转化为可交付的产品。9 月 25 日前注册,门票最高可省 200 美元。对 AI 与机器人创业公司而言,从 demo 走向量产通常卡在供应链、可靠性与交付节奏上,这类一线经验比融资故事更有参考价值,也说明行业的关注点正从模型能力转向落地与规模化能力。

来源:TechCrunch AI·原文

Meta 推出 AI 订阅套餐 Meta One,把 AI 工具与社交会员打包变现

Meta 扩展订阅业务,推出以 AI 为核心的新套餐 Meta One,把公司 AI 工具的扩展访问权限与 Facebook、Instagram、WhatsApp 的高级功能打包销售。这意味着 Meta 正把 AI 能力从免费功能转为付费权益,试图在广告之外建立更稳定的订阅收入来源。对行业而言,社交平台把 AI 助手与内容工具纳入会员体系,可能推动更多消费级 AI 产品转向订阅制,也会加剧其与 OpenAI、Google 在个人 AI 服务上的用户争夺。

来源:TechCrunch AI·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

WIRED:白宫明确反对AI监管,美国短期内难出台联邦立法

WIRED报道称,尽管外界对AI模型失控的担忧持续升温,美国短期内仍不太可能出台AI监管立法,白宫更明确反对对AI进行监督。这意味着联邦层面的规则真空可能延续,各州立法与行业自律将承担主要约束角色。对AI企业而言,合规不确定性正从「等待统一规则」转向「逐州应对加自愿承诺」,产品发布节奏与数据使用策略需要更早评估地方性要求。

来源:WIRED AI·原文

Google介绍Gemini做家务的四种用法,继续押注日常场景

Google官方博客发文,介绍如何用Gemini处理家务,包括制定餐食计划、排查家电故障等四类用法,并配以「门把手坏了怎么修」这类提示词示例。这是Google把Gemini从通用助手推向高频生活场景的又一步,意在通过具体任务提升用户留存。对做AI助手与Agent的团队来说,值得关注的是官方如何用低门槛场景教育普通用户,把模型能力转化为可复用的日常习惯。

来源:Google AI Blog·原文

Snap高价智能眼镜实测:靠AI应用支撑实时翻译与运动辅助

WIRED记者体验了Snap新推出的智能眼镜,认为这款外形厚重、价格不菲的设备被Snap视为人类计算的未来形态。其核心由一款新的AI应用支撑,功能覆盖实时语言翻译到改善高尔夫挥杆等场景,报道同时提到可穿戴摄像头带来的隐私争议。对AI硬件赛道而言,这再次说明眼镜类产品的竞争力取决于AI功能是否足够刚需,而非单纯堆叠传感器与算力。

来源:WIRED AI·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Anthropic:Salesforce 接入 Claude 测试版,内置 37 项销售技能

Claude 官方账号宣布,Salesforce in Claude 已进入测试版,把客户账户、商机和销售管道数据带进 Claude,并预置 37 项销售技能。用户可以在同一段对话里准备通话、复盘一笔交易、生成管道看板或直接发出预测,不必在 CRM 与聊天窗口之间来回切换。值得关注的是,模型厂商正把 Agent 能力直接嵌进企业既有工作流,而不是要求团队迁移到新工具;对做企业 Agent 的团队来说,如何与 Salesforce 这类系统共存、拿到数据权限并复用其对象模型,可能比自建一套界面更关键。

来源:Follow Builders·原文

Dan Shipper(Every CEO):只输出概率的模型在判断任务上快 25 倍、便宜 600 倍

Dan Shipper 说,Every 几乎从不测试新的基础模型,但这次已经试了大约一周,结果相当惊人。他指出,这类模型不生成文字,而是输出概率,因此可以在需要 Fable 级模型判断力的场景里充当裁判;在他们的测试中,它速度快 25 倍、价格低 600 倍。他判断这类能力在 6 到 12 个月内会变得不可或缺。对做 Agent 评测与数据标注的团队来说,这提示了一条现实路径:用更轻的判别模型替换昂贵的强模型判断,以成本换规模,但前提是先验证判别质量是否稳定。

来源:Follow Builders·原文

Thariq:多数集成场景下 MCP 已优于 CLI,工具调用更强且已无状态

Thariq 表示,他原本没预料到会这样,但现在认为对大多数集成场景来说 MCP 比 CLI 更好。理由是模型在工具调用上进步明显,工具可以被延迟加载,而且 MCP 现在已经无状态。他还给出一条实践建议:如果需要组合或过滤数据,就在 MCP 工具里加上 query 这类参数。这对正在设计 Agent 工具层的开发者有直接启发——过去选 CLI 往往是为了复用现成命令和权限体系,但当模型调用工具足够可靠、协议又去掉了状态负担后,把能力封装成 MCP 工具可能更容易被模型正确选择与组合。

来源:Follow Builders·原文

Guillermo Rauch(Vercel CEO):成立 Vercel Labs,公开研究过程与失败实验

Guillermo Rauch 正式介绍 Vercel Labs,定位是 Vercel 的公开研究与实验部门。他提到在累计 2.47 亿次下载之后,团队希望同样公开地分享自己在支持什么、在研究什么,以及哪些实验最终没有跑通,并点名感谢两位同事推动这项计划、坚持在公开环境中迭代。对开发者工具与 AI 基础设施创业者来说,这个动作值得注意:把失败实验一并公开,既是招募与生态建设手段,也是在快速变化的模型能力面前保持技术判断力的一种方式,因为很多架构选择会在半年内被推翻。

来源:Follow Builders·原文

Amjad Masad(Replit CEO):输出域已知时,不如直接训练模型输出枚举 logprobs

Amjad Masad 针对一种模型研究思路提出反问:如果输出域事先已知,为什么不干脆训练模型直接对枚举值输出 logprobs,而要让它生成自由文本再解析?他的观点指向一个工程取舍——当任务空间可穷举时,把结构化约束内建进模型输出层,比事后做格式校验和重试更省事,也更容易拿到可用的置信度。对做 Agent 和工具调用的人来说,这意味着在分类、路由、状态选择这类封闭决策上,枚举式输出可能比自然语言更稳、更便宜。

来源:Follow Builders·原文