TodayAI

TODAYAI DAILY

AI 日报2026-09-20

Meta Muse 登陆 Mac 可代操作文件;迪士尼任命首位CTO,来自Character.AI前CEO | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

Datasette 的 GitHub 登录插件发布 1.0,修复移动端会话频繁失效

Datasette 生态中的登录插件 datasette-auth-github 发布 1.0 正式版。作者 Simon Willison 在 agent.datasette.io 演示站点上运行该插件时发现,已认证会话的存活时间异常短暂;排查后确认,插件写入 Cookie 时没有设置 Max-Age 参数,导致会话在浏览器关闭后即失效,在移动端 Safari 上会频繁触发,且与用户如何使用应用无关。该问题已在 #80 中修复。由于插件已存在较长时间、测试覆盖较完整,作者认为可以发布 1.0。对自建数据工具与内部 Agent 演示站的开发者而言,这类会话过期问题会直接影响登录体验与调试效率,升级到 1.0 可避免移动端反复掉登录态。

来源:Simon Willison·原文

GitHub 播客:该不该读代码、RAG 是否已死、Skills 是否取代 MCP

GitHub 官方博客发布新一期播客,围绕 AI 开发中的几个热门断言展开:开发者是否还应该阅读代码、RAG 是否已经过时、Agent Skills 是否杀死了 MCP。节目指出,热门断言把复杂问题压缩成一句自信的结论,适合传播却不利于理解;真正有价值的部分在于拆解它——在什么条件下成立、缺失了哪些上下文、隐含了哪些假设、放到真实工程中会发生什么变化。对正在搭建检索与工具调用链路的团队来说,这期讨论提供了一个判断框架:不要因为一句流行口号就替换现有架构,而应先明确自身场景对上下文长度、工具协议与可维护性的真实需求。

来源:GitHub Blog·原文

MIT 科技评论:AI 让生物武器风险上升,为生物科技敲响警钟

MIT 科技评论撰文指出,AI 可能让生物武器的制造变得异常容易:2022 年有研究者在不到六小时内用药物发现类 AI 生成四万种潜在化学战剂,其中部分毒性超过已知神经毒剂。文章同时提到现有防护存在明显局限——Anthropic 近期确认有用户试图利用其模型让病毒更具传播性和危险性,说明防护与绕过之间是持续的攻防。科学界对此分歧明显:一些生物学家认为当前 AI 工具尚不足以完整开发生物武器,另一些则警告有决心的行为者最终会成功。对生物科技与 AI 安全从业者而言,这意味着模型能力评估需要把滥用路径纳入常规红队范围。

来源:MIT Technology Review AI·原文

WIRED:一款会发出数据中心噪音的毛绒玩偶

WIRED 报道了一款名为 Bezzy 的毛绒玩偶,由创意工作室与 Big Data 背后的音乐制作人合作推出,属于讽刺性作品。它的外形是可爱的小玩偶,却会播放真实数据中心里的声音,包括风扇与设备运转产生的刺耳噪音。这件作品把 AI 基础设施的物理侧面——耗电、散热与持续轰鸣的机房——变成可以抱在手里的消费品,用反差感提醒人们:模型与算力并不只存在于云端界面,背后是真实运转的硬件与能源消耗。对关注 AI 叙事与公众认知的团队来说,这类文化产品提供了一个观察角度:基础设施成本正逐渐进入大众话题。

来源:WIRED AI·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

Google 扩充 AI 与经济研究团队,引入学术顾问与研究员

Google 宣布扩充其 AI 与经济(AI & Economy)团队,新增一批学术顾问、外部研究员以及内部核心研究人员。该团队由首席经济学家办公室与科技社会部门相关人员牵头,研究方向聚焦 AI 对劳动力市场、生产率与整体经济结构的影响。此举的背景是,AI 对就业与增长的冲击已成为监管者和政策制定者关注的核心议题,科技公司需要拿出更系统的实证研究来参与规则讨论。对行业而言,这意味着头部厂商正把“AI 经济影响”从公关话术升级为长期研究项目,其结论可能影响未来的政策建议与公众叙事。值得关注的是这些研究是否会公开数据与方法,以及结论与公司商业利益之间如何保持距离。

来源:Google AI Blog·原文

Meta 的 Muse 登陆 Mac,可代用户操作文件与应用

Meta 旗下 AI 助手 Muse 正式推出 Mac 版本,可在本地与用户的文件和应用程序协作,代替用户执行具体操作。与此前偏对话式的助手不同,Muse 更接近“代操作代理”:它能读取文件、调用应用并完成多步任务,把自然语言指令落成桌面上的实际动作。这一方向与近期各大厂商竞逐的计算机使用代理(computer use)一致,难点集中在权限边界、操作可撤销性,以及误操作后的数据安全。对 Meta 而言,把 Muse 从移动端延伸到桌面,意味着它开始争夺日常生产力入口,而不只做社交场景内的问答。后续值得关注的是它如何处理敏感文件授权,以及是否向第三方应用开放操作接口。

来源:TechCrunch AI·原文

Google 与设计师合作定制 Flow 工具,用于纽约时装周筹备

Google 与设计师 Jane Wade、Sergio Hudson 合作,为纽约时装周的筹备流程定制了 Google Flow 相关工具。按官方说法,双方是并肩协作完成工具设计,目标是把生成式能力嵌进服装设计、视觉素材准备等具体环节,而不是丢一个通用聊天界面让设计师自己摸索。这是典型的“垂直场景共创”路径:先与少数专业用户深度打磨工作流,再考虑规模化。对创意行业而言,这类合作的价值在于验证 AI 能否真正进入专业生产管线,而不只是画灵感草图。后续需要观察这些定制工具是否会产品化并向更多设计师开放,以及版权与原创性归属如何界定。

来源:Google AI Blog·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

Claude Code 2.1.277 起支持 AGENTS.md,项目指令走向可插拔 mod

Anthropic 的 Thariq Shihipar 表示,Claude Code 自 2.1.277 版本起支持 AGENTS.md:当目录下没有 CLAUDE.md 时,Claude 会转而读取 AGENTS.md 作为项目指令。该能力基于即将推出的定制机制 Claude Code mods,AGENTS.md 支持本身就是一个内置 mod,开发者也能按需构建自己的项目指令版本。对同时使用多种编码工具的团队来说,同一份仓库级约定有望被不同编码 Agent 共用,省去为每个工具重复维护指令文件的成本;不过迁移前仍需确认各工具对 AGENTS.md 的解析范围和优先级是否一致。

来源:Simon Willison·原文

ContextsBase 把聊天提示词整理成编码 Agent 的任务待办

ContextsBase 在 Product Hunt 上以「Backlog for Coding Agents」的定位发布,核心思路是把开发者与 AI 的聊天提示词沉淀为结构化的 AI 待办列表,让零散对话变成可追踪、可排序、可分配的任务队列。它面向同时使用多个编码 Agent、却缺少统一任务入口的开发者和小团队,解决提示词散落在会话里、用完即弃、难以复盘与交接的问题。其做法是把自然语言对话直接当作任务来源,而不是要求人先写工单再喂给模型,适合已把 Agent 纳入日常开发流程的团队评估它与现有看板工具的衔接方式。

来源:Product Hunt AI·原文

一份从 NumPy 到 Transformer 的机器学习学习仓库公开

有开发者在 Reddit 的 Machine Learning 板块分享了自己的机器学习学习仓库 ML-Foundations,称用五个月时间保持每日提交,全部 notebook 公开。内容覆盖从经典机器学习(scikit-learn、XGBoost)到深度学习(TensorFlow/Keras 的 ANN、CNN、RNN、LSTM),还包括 NumPy 与 Pandas、数据可视化、NLP 基础、统计与 SQL,基本串起一条从基础到 Transformer 的学习路径。对刚入门或想补齐工程基础的人来说,这类按主题分层的公开笔记可以作为自学路线参考;不过它属于个人学习记录,代码与结论未经系统评测,用于生产前仍需自行验证。

来源:Reddit Machine Learning·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

研究者追问:多模型轮流对话,是否真优于单向共享与自我精炼?

有研究者在 r/MachineLearning 提出一个尚待验证的实验设计:让两个不同的大模型以固定顺序来回交互(X 起草、Y 回应、X 修订、Y 再修订),在受控算力预算下,其任务成功率是否高于“独立起草后聚合”“单向共享”“各自自我精炼”等强基线。提问者坦言文献检索尚未完成,也不主张新颖性,并因 ChatGPT 与 Claude 的引用处理不可靠而拒绝直接引用来源。这条讨论的价值在于把笼统的“多智能体协作”拆成可对照的实验变量,提醒开发者搭建 Agent 工作流前,先做小规模对照实验再投入成本。

来源:Reddit Machine Learning·原文

Latent Space 观察:Jev 发布两天内出现六个克隆项目

Latent Space 的 AINews 栏目提到,Jev 相关项目在发布后两天内出现了六个克隆版本,其发布视频获得约 3600 万次观看。文中还引用 Vercel 方面的数据称,某工具已触达约 13% 的团队,规模约为 GPT-5.6 系列的两倍、Fable 5.1 的六倍。这组对比反映出当前 AI 工具赛道的一个特点:产品形态一旦被验证,模仿与复刻的速度极快,先发者的窗口期被大幅压缩。对开发者与创业团队而言,单纯的功能领先难以构成长期壁垒,分发渠道、生态集成与持续迭代节奏可能才是决定留存的关键变量。

来源:Latent Space·原文

交互式演示揭示 ReLU 全连接网络的表达能力上限

有开发者做了一个可交互演示,用来直观观察神经网络拟合不同函数的过程,用户可以自行调整网络架构与待逼近的目标函数。演示指出,使用 ReLU 激活的全连接网络本质上生成分段线性函数:单隐层网络能产生的最大分段数为 1 加上该层宽度,例如宽度为 3 时最多 4 段;再叠加一个隐层,分段数相乘,宽度组合「3 3」对应最多 16 段。不过训练后的网络通常达不到这一理论上限。该演示对理解模型容量与深度、宽度的关系有教学价值,也提示实际训练中优化难度会限制表达能力的兑现。

来源:Reddit Machine Learning·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

迪士尼任命首位CTO,人选来自曾被其发函指控的Character.AI前CEO

TechCrunch 报道,迪士尼设立公司史上首个首席技术官职位,出任者是 Character.AI 前 CEO。值得注意的是,迪士尼此前曾向 Character.AI 发出停止侵权函,指控其角色形象涉嫌抄袭自家 IP。这一任命把“版权冲突方”变成“技术掌舵人”,说明传统内容巨头在自研 AI 能力不足时,更倾向直接吸纳已跑通消费级 AI 产品的团队负责人。对行业的影响在于,IP 方与 AI 生成公司之间从诉讼对抗转向人才与授权合作,可能成为内容产业处理 AI 版权问题的新路径,但双方原有法律争议如何收尾仍待观察。

来源:TechCrunch AI·原文

AWS 首席应用科学家在 Reddit 开 AMA,谈 Bedrock 与 Lex 的一线工程经验

AWS 首席应用科学家 James Gung 在 r/MachineLearning 发起 AMA,介绍其 2021 年加入亚马逊后参与 Bedrock、Lex、Q Business 与 Amazon Quick 等 AI 服务,研究方向覆盖任务型对话、Agent 评测、对话模拟与主动式 Agent;此前在 Amelia 从事对话 AI,并在科罗拉多大学博尔德分校取得计算机博士。他明确表示以个人身份发言,不涉及未发布产品、财务、竞品、内部工具、法律、定价与客户数据。对开发者而言,这类一线科学家问答的价值在于了解大厂 Agent 评测与对话系统落地的真实取舍,而非官方宣传口径。

来源:Reddit Machine Learning·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

WIRED 将于 11 月 4 日在迈阿密举办 World Fair 线下活动

WIRED 宣布将于 11 月 4 日在迈阿密举办为期一天的 World Fair 活动,把其报道中长期关注的技术、人物与文化力量从纸面搬到线下,议题涵盖人工智能、机器人等方向。对产业而言,由科技媒体主导的这类线下大会正成为 AI 公司、投资人与文化机构集中亮相的场域:既是品牌曝光渠道,也是观察行业叙事风向的窗口——议程设置往往提前反映下一阶段资本与舆论的关注重点。

来源:WIRED AI·原文

与 AI 实验室关联的 PAC 向南达科他州参议院选战投入近 100 万美元

WIRED 报道称,与 AI 实验室及投资人关联的政治行动委员会(PAC)已在一场原本并不受关注的南达科他州参议院选举中投入近 100 万美元,支出规模甚至超过当地居民自身的政治捐款。该席位传统上由共和党稳定占据,且已有现任者参选,因此这笔投入更像是围绕选举关系与政策影响力的提前布局。对 AI 行业来说,这意味着模型公司及其资本方开始把政治捐款当作影响未来监管议程的工具,围绕 AI 立法与合规的游说竞争可能进一步升温。

来源:WIRED AI·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Nikunj Kothari(FPV Ventures 合伙人):投资人每天写两小时代码,才能看懂模型下一步

Nikunj Kothari 说自己每天花约两小时写代码、做副项目、翻新仓库,几乎每天都有人私信问他:“你是 VC,为什么还干这个?”他的回答是:这一轮变化太快,不亲手做就无法理解接下来会发生什么。他把学习路径拆成三层——读技术论文理解模型能力的边界,看工具与基础设施如何支撑更长周期的任务,理解应用层 harness 如何让模型真正跑起自主业务。他也承认可以靠和研究者、创业者聊天来学,但自己只有动手才学得进去,因此建议想入门的人每天挤出时间折腾,坚持十天大概率会上瘾。

来源:Follow Builders·原文

Claude 官方账号:周末在造什么?把问题抛给开发者社区

Claude 官方账号发了一条极简提问:“这个周末你在造什么?”没有产品公告,也没有功能更新,更像是一次面向开发者社区的开放式征集。这类互动本身信息量不大,但反映出模型厂商正把社区运营当作产品反馈渠道:通过收集真实项目类型,判断开发者把模型用在哪些场景、卡在哪些环节。对开发者来说,这类提问的价值在于它暴露了官方关注的方向,也提供了一个低成本展示自己项目、获得同行与官方注意的窗口。

来源:Follow Builders·原文

Aaron Levie(Box CEO):个人 Agent 时代,要争夺的是 Agent 的注意力

Aaron Levie 认为,个人 Agent 是“造 Agent 想要的东西”这一理念的终极形态。以 Muse 这类产品为例,用户希望把任务整个交出去并确保端到端完成,这就要求 Agent 能顺畅操作你的工具,或者自带工具:接入你的 MCP 或 CLI、轻松导航你的网站、完成交易等。他提出一个关键判断:新的注意力争夺对象不再是用户本人,而是 Agent。谁能最好地让 Agent 点餐、处理电商交易、订机票、接入本地经济与数据,谁就会被用得最多。他称这将是自 App Store 以来消费科技最大的一次机会与洗牌。

来源:Follow Builders·原文

Aaron Levie(Box CEO):用小模型做企业流程里的秒级判断,几乎零成本

Aaron Levie 演示了 Box 与 Jev 的配合:从 Box 中取出一份事故报告,判断它是否面向客户、严重程度如何,再把文件移入升级、监控或复核文件夹,并写入一条元数据模板实例。整个过程几乎瞬时完成,成本也极低。他认为这类能力适合 Agent 在工作流中做瞬间决策、数据分类和判断性调用,可延伸到保险理赔、合同管理、贷款审批、安全审查、客户日志分析等场景,构成一类新的 AI 用例。对企业而言,这意味着不必把每个判断都交给大模型,小模型加流程编排就能覆盖大量高频、低风险的决策。

来源:Follow Builders·原文

Thariq(Anthropic Claude Code 团队):AGENTS.md 是 Claude Code mods 的第一个内置样例

Thariq 透露,AGENTS.md 支持并非独立功能,而是构建在 Claude Code mods 之上——这是团队即将推出的 harness 定制机制。也就是说,项目指令文件只是官方提供的一个内置 mod,未来开发者可以按同样方式自建定制版本的项目指令。这释放出一个信号:Claude Code 正从固定工具转向可插拔的 harness,团队可以把编码规范、评审流程、上下文注入方式封装成自己的 mod,而不是被动等待官方支持。对做 Agent 工具链的团队来说,值得提前思考哪些工作流适合沉淀为可复用的 mod。

来源:Follow Builders·原文