TodayAI

TODAYAI DAILY

AI 日报2026-09-18

GitHub用Rust重写Copilot运行时,产出80万行代码;英伟达CUDA支持Rust写GPU内核 | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

GitHub 借 Copilot 将 Copilot 运行时迁移到 Rust,产出超 80 万行代码

GitHub 官方博客披露,团队已将 Copilot agent 运行时从 TypeScript/Node.js 完整迁移到 Rust,产出超过 80 万行生产级代码,并称这一规模的改写在此之前“用人力根本负担不起”。文章强调,迁移过程本身由 GitHub Copilot 应用与 Copilot CLI 参与完成,覆盖 Copilot 与 Copilot CLI 等由同一 agent 运行时支撑的产品线。对开发者的直接影响是:agent 运行时的性能、内存占用与跨平台分发能力可能改善;同时这也是一次大规模“用 agent 重写 agent 基础设施”的公开样本,说明 AI 编码工具已能承担超大型、强类型、长周期的系统级重构,而不只是补全函数或修小 bug。

来源:GitHub Blog·原文

Google Home 开放 MCP 服务器早期访问,AI 代理可控制智能家居

TechCrunch 报道,Google 为 Google Home 推出 MCP 服务器的早期访问,允许 Claude、ChatGPT 等 AI 代理通过自然语言控制已连接的智能家居设备、查看摄像头摘要并访问家庭活动记录。这意味着智能家居正从“人点 App”转向“代理代为操作”,MCP 成为设备侧能力对外的标准接口。对开发者的影响在于:家庭场景可能成为 agent 落地的下一批高频入口,权限边界、设备授权与隐私审计会成为必须提前设计的问题;对平台而言,谁能定义代理访问家庭设备的授权与计费规则,谁就更接近家庭 AI 的入口位置。

来源:TechCrunch AI·原文

Anthropic 将 Claude Cowork 与聊天合并为统一的 Claude

Simon Willison 记录,Anthropic 开始把 Claude Cowork 与普通聊天合并为同一个 Claude:用户既可以问一个快问题,也可以把中午要交的报告直接交给它,即使合上笔记本,任务仍会继续推进。该变化先在 Pro 与 Max 套餐上线,随后数周内逐步覆盖 Web、桌面与移动端的现有及新用户。这被解读为 Claude 正从“对话产品”转向通用 agent,与 OpenAI 把 Codex 桌面应用改名为 ChatGPT 的思路相呼应。对用户和开发者而言,产品边界被抹平后,任务型工作流与对话式交互将共用同一入口,围绕 Claude 构建工具的人需要重新判断自己的功能该挂在哪个面上。

来源:Simon Willison·原文

RepoAtlas 提出免训练多模态仓库视图,提升编码代理定位能力

arXiv 论文 RepoAtlas 针对编码代理在仓库级问题修复中的痛点:不仅要生成看似合理的补丁,还要在相互依赖的文件间定位相关代码,并维持既充分又聚焦的上下文。代码图能表达非局部关系,但线性文本界面会掩盖拓扑结构;渲染完整仓库图又过于密集、难以可靠感知,一次性局部视图则会随探索推进而过时。该工作提出一个免训练模块,通过“选择—投影—刷新”循环,在仓库代码图上维护不断演进的多模态视图。对 agent 工程的启发是:上下文管理正从“塞更多 token”转向结构化、可更新的仓库表示。

来源:arXiv cs.AI·原文

国产开源多模态模型 ZDTaichu5.0-9B 发布,九项空间测试中八项居首

据量子位报道,国产开源多模态模型 ZDTaichu5.0-9B 正式发布。官方称其在保持通用能力不下降的前提下,于空间具身智能方向取得明显优势:在九项空间相关测试中,该模型在 10B 参数规模的通用模型里拿下八项第一,被描述为跻身全球多模态第一梯队。报道强调其开源属性,意味着研究者和开发者可以直接获取权重进行复现与二次开发,而不必依赖闭源接口。空间具身能力通常涉及对三维位置、物体关系与可操作性的理解,是机器人操作、导航与仿真训练的关键前置能力,此前多由更大规模模型或专用模型承担。若该评测结果在第三方复现中成立,10B 级别即可同时覆盖通用与空间任务,将降低具身智能团队的算力与部署门槛,并可能推动更多开源生态围绕空间理解构建工具链与数据集。目前相关结论主要来自发布方与媒体报道,具体评测细节、对比基线与复现条件仍待社区验证。

来源:量子位·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

英伟达让 CUDA 支持 Rust 写 GPU 内核,给出两条技术路线

英伟达开发者博客宣布,CUDA 正式支持用 Rust 编写 GPU 内核,并给出两条技术路线:一条偏向与现有 CUDA C++ 生态互操作,另一条更贴近 Rust 原生工具链与内存安全模型。这意味着长期由 C/C++ 主导的 GPU 编程开始向系统级语言开放,Rust 的借用检查与包管理有望降低内核开发中的内存错误和构建复杂度。对做推理引擎、算子库和异构计算的团队来说,多了一种在安全性与性能之间取舍的工程选项,但迁移成本与生态成熟度仍需观察。

来源:Hacker News·原文

Mistral 与 Mozilla 合作,把开放多语言 AI 带进浏览器

Mistral 与 Mozilla 宣布合作,将开放、私密且支持多语言的 AI 能力引入浏览器场景。官方表述强调把可信 AI 放到用户日常浏览的位置,方向上偏向端侧或本地化推理,以减少数据外传并覆盖更多语种。对浏览器厂商而言,这是把 AI 从云端插件变成基础能力的一步;对 Mistral 而言,则是在消费级入口上扩大模型分发面。实际落地形态、模型规模与隐私边界尚未完全披露,端侧算力与体验的平衡仍是关键变量。

来源:Mistral AI News·原文

macOS 27 Golden Gate 评测:Apple Intelligence 迎来首次重大升级

Ars Technica 发布 macOS 27 Golden Gate 评测,称其既是类似 Snow Leopard 的稳定性更新,也是 Apple Intelligence 的一次重大跃升。评测指出,安装该系统后生成式 AI 几乎无法回避:此前用户可以关闭 Apple Intelligence 并删除其下载的数 GB 模型,如今这一开关已不存在,AI 能力从营销、功能到芯片与磁盘占用都定义了这一版本,苹果还带来了新版 Siri。对开发者而言,系统级 AI 默认开启会改变应用调用与隐私合规的默认前提。

来源:Ars Technica·原文

Anthropic 把 Claude 聊天与 Cowork 合并进同一界面

TechCrunch 报道,Anthropic 把 Claude 聊天与 Cowork 合并到同一个界面中,初期面向 Pro 和 Max 订阅用户开放。此举把对话式问答与协作式任务执行收敛到统一入口,减少用户在不同产品形态之间切换的成本,也意味着 Anthropic 正把 Agent 式工作流当作订阅价值的核心组成部分。对团队用户来说,聊天与协作合流后,权限、上下文与任务追踪如何统一管理,将直接影响其在企业场景中的可用性。

来源:TechCrunch AI·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

HarnessTax:同一模型换不同脚手架,编码 Agent 表现相差多少

有开发者发布 HarnessTax 项目,专门量化“脚手架”对编码 Agent 表现的影响:同一个底层模型,换用不同的 Agent 框架、工具调用方式与上下文管理策略,任务成功率和 token 消耗会相差多少。项目把差异部分称为“harness tax”,试图把模型能力与工程封装能力拆开衡量。对正在选型或自研编码 Agent 的团队来说,这类测量比单纯刷模型榜单更有参考价值:如果换脚手架带来的收益大于换模型,优化重点就应放在工具设计、上下文压缩和失败重试上,而不是一味追新模型。

来源:Hacker News·原文

论文提出可执行评测框架:用 ground-truth-as-code 检验数据科学 Agent

arXiv 上新论文提出一套针对数据科学 Agent 的评测框架,核心思路是“ground-truth-as-code”:把每个期望答案写成可执行参考函数,评测时直接从实时数据重算答案,避免静态参考答案随数据更新而过期。论文以“上周受众规模是多少”为例,说明传统 LLM-as-a-judge 流水线无法对照固定真值验证回答。框架还引入按事实点拆分、与格式无关的评判器,把 Agent 回答与计算结果对齐比较。对做数据 Agent 的团队来说,这意味着评测集需要从静态快照转向可执行、可重算的验证逻辑,否则线上数据一变,评测结论就会失真。

来源:arXiv cs.AI·原文

Datamimic:让编码 Agent 使用受控数据,而不是自己编造测试世界

开源项目 Datamimic 针对一个常见痛点:编码 Agent 在写测试时,往往自行编造一套看似合理、却脱离真实分布的假数据,导致测试通过却掩盖了真实问题。Datamimic 提供可控的数据生成能力,让开发者定义字段、约束与分布,为 Agent 提供一个确定性的测试世界,而不是让它自由发挥。对把 Agent 接入 CI 的团队来说,这提示测试数据应由工程侧显式声明,Agent 只负责消费;否则测试用例会随模型每次生成而漂移,回归结果失去可比性,也很难判断出问题的是代码还是数据。

来源:Hacker News·原文

网易有道周枫:AI 竞争进入 Model + Agent + Workflow 阶段

在网易有道 AI Open Day 上,CEO 周枫提出 AI 能力竞争正在进入“Model + Agent + Workflow”时代,并展示了有道在 AI 时代的解法。这一判断的落点在于:单点模型能力逐渐同质化后,真正拉开差距的是 Agent 如何编排工具、工作流如何嵌入具体场景。对国内做教育、翻译、办公类产品的团队而言,这意味着竞争重心从“接哪个模型”转向“把模型接进哪条业务链路”,以及能否沉淀出可复用的 Agent 工作流资产,而不只是停留在模型参数与榜单对比上。

来源:量子位·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

分布式JEPA框架:面向异构能源时序的自监督预测

一篇新论文提出分布式联合嵌入预测架构(JEPA),用于从异构能源时序数据中做自监督学习。传统能源预测依赖任务专用监督和固定的资产表示,迁移性差,难以刻画不同设备间共通的时序动态。该框架在共享嵌入空间中预测被掩码时间片段的潜在表示,并融合时序观测与上下文信息;为防止表示坍缩,训练目标同时加入协方差正则与时间方差正则。作者在能耗与发电数据集上、于数据退化条件下进行了评测。其价值在于把自监督预训练引入能源预测,减少对逐任务标注的依赖,为跨设备迁移提供一条可复用的技术路线。

来源:arXiv cs.AI·原文

斯坦福团队将人脑细胞植入小鼠皮层,探索疾病建模新路径

斯坦福大学研究团队报告了一种把人类脑细胞移植到小鼠皮层的方法,用于研究人脑疾病。此前类器官被寄予厚望,它能由干细胞形成多种细胞类型和部分结构,但脑类器官缺乏与专门脑区建立连接的能力,难以表现正常行为。此次实验显示,人类细胞能够向小鼠脑区伸出突起并整合进局部回路,但整体结果相比完全缺失该脑结构仅有轻微改善。这说明人源细胞可以在活体环境中存活并建立连接,为在更接近生理的回路中研究人类神经疾病提供了模型,但功能替代程度仍然有限。

来源:Ars Technica·原文

自适应各向异性注意力:面向轴结构信号的低信噪比建模

针对脑电等结构化、低信噪比信号,论文提出自适应各向异性注意力(AAA)。密集自注意力在训练前把所有 token 对视为同等可能,这种各向同性的先验与沿电极轴和时间轴组织的依赖结构不匹配,会让每个 token 暴露在大量无关交互中。AAA 把注意力拆成两条路径:时间路径让 token 关注同一电极在时间上的其他 token,空间路径让 token 关注同一时刻其他电极的 token;再由一个小门控为每个 token 预测两条路径输出的凸组合,两个非负权重之和为一。作者在六项脑电下游任务上验证了该设计。

来源:arXiv cs.AI·原文

GoBench:用9x9围棋阶梯评测大模型通用推理能力

社区发布 GoBench,用 9x9 围棋对局评测大语言模型的通用推理能力,对手是 KataGo 组成的阶梯,从随机水平一直到超人水平。作者称该基准与 ARC-AGI 2 的相关性达到 0.83,且目前远未饱和。结果显示,GPT-6 Astra 最高约 2500 Elo,明显低于最强 KataGo 的 4400 Elo;若允许使用编码工具并在评测前准备两小时,Codex 配合 Astra 可达到 3560 Elo。该设计把棋力作为推理代理指标,并区分裸模型与工具增强两种设定,为观察模型在长程规划与搜索类任务上的差距提供了可复现的评测口径。

来源:Reddit Machine Learning·原文

B站上线「AI无限竞技场」,首期百大模型测评榜 GPT-6 居首

B站于9月16日正式上线「AI无限竞技场」,并同步公布首期大模型测评榜单,称全球百大模型同场竞技,GPT-6 在榜单中位居首位。该竞技场把模型评测做成可持续更新的公开榜单,意味着中文社区多了一个面向大众的横向对比入口。对开发者而言,榜单可作为选型参考,但需注意评测维度、题目集与投票机制尚未公开说明,排名结果更适合当作线索而非定论,实际选型仍应结合自有任务做小样本验证。

来源:量子位·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

Cloudflare 用机器学习揪出电商前端恶意脚本,曝光四起攻击活动

Cloudflare 发布博客,介绍其客户端安全(Client-Side Security)机器学习模型如何发现传统扫描器漏掉的攻击。文章跟踪了四起攻击活动、共八种载荷,这些恶意 JavaScript 会在页面看似正常、商品正常展示、结账流程可用的前提下,悄悄窃取联盟营销收入、劫持搜索与点击、篡改分析数据,甚至向远程服务器请求下一步要执行的代码。对电商与开发者平台而言,这意味着安全边界已从服务器延伸到浏览器内部,前端脚本的持续监控与人工分析能力正成为商业化基础设施的一部分。

来源:Cloudflare Blog·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

TechCrunch:AI 实验室急着设内部审计,不如先把“前门”关上

TechCrunch 刊文讨论 AI 实验室设立内部审计团队的动向。作者 Tim Fernholz 提出一个反问:与其事后增设审计岗位,不如先把系统入口和权限边界收紧。文章认为,失控 Agent 带来的风险往往来自访问权限过宽、缺少默认拒绝机制,而非缺少事后检查。对正在把 Agent 接入生产环境的团队而言,这意味着安全投入应优先放在最小权限、工具白名单、操作留痕与人工确认上,而不是等出事后再补审计流程。

来源:TechCrunch AI·原文

Google 与 RXN 调研:青少年对 AI 的态度比想象中更审慎

Google 博客发布与 RXN 合作的青少年 AI 认知调研,结论显示青少年对 AI 既好奇也有保留,并非简单地全盘接受或排斥。研究由 Google 儿童与家庭 UX 研究负责人 Jennifer Kotler 撰写,属于面向家庭场景的产品研究。对做教育、陪伴或青少年向 AI 产品的团队来说,这类一手调研提示:面向未成年人的功能设计需要更透明的能力边界说明、更清晰的错误提示,以及家长可参与的使用引导,而不只是强调模型有多强。

来源:Google AI Blog·原文

Snap 再为 2200 美元智能眼镜辩护,试图证明高价合理

TechCrunch 报道,Snap 再次为其售价 2200 美元的智能眼镜 Specs 展开市场沟通,试图解释这款产品为何值得存在。自今年早些时候 Specs 首次亮相以来,Snap 一直在寻找机会向外界说明其产品定位与价值主张。2200 美元的定价远高于当前主流消费级智能眼镜,这意味着 Snap 必须给出足够有说服力的使用场景,才能让用户接受这一价格带。对行业而言,Snap 的尝试也反映出智能眼镜赛道在硬件成本、AI 功能集成与消费者付费意愿之间仍存在明显张力,高价策略能否跑通,将影响后续厂商的定价与产品路线选择。

来源:TechCrunch AI·原文

MIT 科技评论:人脑细胞小鼠引发神经研究与伦理双重讨论

MIT 科技评论报道,研究人员在小鼠体内培育出人类脑组织,使其皮层相当比例由人类细胞构成,并通过多机位摄像与计算机追踪记录小鼠在场地中的运动轨迹。该工作被认为可能为脑损伤研究提供新路径,但把人类脑组织与动物结合也带来伦理争议。对 AI 与神经科学的交叉领域而言,这类研究既可能为类脑计算与神经接口提供实验依据,也提醒相关数据与样本使用需要更明确的伦理审查框架。

来源:MIT Technology Review AI·原文

arXiv 论文:AI 辅助工作该如何设计元认知监测干预

arXiv 论文《Beyond "ChatGPT Can Make Mistakes"》研究 AI 辅助场景下的元认知监测问题:用户既要判断自身能力,也要判断系统是否可靠。作者从 11 位专家处收集 30 种干预手段,按时间、判断层级与线索来源构建设计空间,并用 917 人、12 类规划组织任务的组间实验,对比逐任务可靠性卡片、对比式回复、暂停点与事后反思等方案。结果显示不同干预效果存在差异,为 AI 产品如何提示不确定性提供了可比较的实证依据。

来源:arXiv cs.AI·原文