TodayAI

TODAYAI DAILY

AI 日报2026-08-19

谷歌与英国合作启动“蓝色天空”项目;Mojo编程语言正式开源;阿里开源Qwen3.8-27B | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

MIT研究:AI公司报告掩盖真实使用情况,独立平台揭示模型差异

MIT Technology Review报道,AI公司(如Anthropic和OpenAI)定期发布用户如何使用Claude和ChatGPT的报告,但研究人员指出,这些数据仅反映公司选择公开的部分,缺乏独立验证。斯坦福大学博士生Anka Reuel表示,没有独立数据能佐证这些说法。为此,AI Observatory平台聚合了近25,000条真实用户对话,覆盖七个数据集,提供未经公司过滤的使用情况。分析发现,不同模型的使用场景差异显著:Grok用户偏向新闻和政治(包括错误信息),Claude吸引程序员,Gemini用于角色扮演,ChatGPT则常被用作作业助手。这些差异在单一公司报告中无法体现。研究强调,政策制定者和研究人员基于不完整、自利的数据做决策存在风险,独立数据源对于理解AI的实际影响至关重要。

来源:MIT Technology Review AI·原文

Block开源Apache 2.0桌面Agent工作台Berd,支持多模型与本地存储

Block公司(由Jack Dorsey创立,旗下拥有Square、Cash App和Tidal)近日宣布开源其内部AI Agent工作台Berd。Berd是一款本地安装的图形桌面应用,而非浏览器工具,旨在为员工提供统一的AI Agent环境,支持跨模型、工具和项目操作。该项目采用Apache 2.0许可,允许商业使用和修改,并提供macOS、Windows和Linux版本。截至8月18日,仓库版本为0.6.2,已有91位贡献者。Block的AI能力负责人Brad Axen表示,选择桌面优先的设计,是因为其价值在于直接与本地项目、文件、工具和Agent交互。Berd支持多种模型和框架,并本地存储对话历史,从而增强隐私和可控性。该开源举措有望推动Agent工作流的标准化。

来源:VentureBeat AI·原文

AI Observatory揭示:模型使用差异大,公司报告聚焦工作场景

MIT Technology Review的The Download通讯指出,AI公司发布的使用报告只展示他们想公开的数据,且缺乏独立验证。新研究项目AI Observatory通过分析近25,000条真实对话填补了这一空白,发现用户行为比公司报告显示的更为敏感,且公司报告更侧重工作用途,忽略个人使用。不同模型的使用模式差异明显:Grok用户更关注新闻和政治,Claude吸引程序员,Gemini用于角色扮演,ChatGPT则常用于作业。这些差异在单一公司报告中无法体现。研究人员强调,当前决策基于不完整、自利的数据存在风险,独立数据对理解AI实际影响至关重要。该研究为政策制定者和研究人员提供了更全面的视角。

来源:MIT Technology Review AI·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

谷歌详解AI洪水预测技术:Flood Hub与Groundsource如何助力全球防灾

谷歌研究员在最新博客中介绍了AI技术在洪水预测领域的应用,重点展示了Flood Hub和Groundsource两个工具。Flood Hub利用机器学习模型分析水文数据,可提前数天预测洪水风险,覆盖全球多个易受灾地区;Groundsource则通过众包方式收集地面信息,补充卫星数据,提高预测精度。这些工具旨在帮助政府和社区提前采取防范措施,减少人员伤亡和财产损失。谷歌表示,AI预测洪水的能力正在持续提升,未来将覆盖更多地区,为全球气候变化应对提供技术支持。

来源:Google AI Blog·原文

苹果带摄像头AirPods或通过设计避免隐私争议:无法录制照片和视频

据TechCrunch报道,苹果泄露的带摄像头AirPods可能通过设计限制避免隐私问题。与Meta Ray-Ban等AI穿戴设备不同,苹果的AirPods摄像头可能被设计为无法录制照片或视频,仅用于环境感知和AI功能,如视觉辅助或Siri交互。这一设计旨在缓解消费者对“偷拍”的担忧,即所谓的“变态耳机”问题。分析师认为,苹果此举体现了对隐私的重视,但也可能限制其功能扩展。目前苹果尚未官方确认该产品,但泄露信息显示其可能在未来发布。

来源:TechCrunch AI·原文

谷歌与英国合作启动“蓝色天空”项目:用AI减少航空尾迹对气候影响

谷歌宣布与英国合作开展“蓝色天空”项目,这是一项基于AI的尾迹规避试验,旨在减少航空业对气候的影响。飞机在高空飞行时产生的尾迹(凝结尾迹)会形成卷云,加剧温室效应。该项目通过AI预测尾迹形成条件,并建议飞行员调整航线,从而避免在特定区域产生尾迹。试验将在英国空域进行,覆盖整个空域尺度,评估AI在真实运营中的有效性。谷歌表示,这一项目有望为航空业提供可落地的减排方案,助力实现气候目标。

来源:Google AI Blog·原文

阿里开源Qwen3.8-27B:本地运行前沿编码Agent与推理,无需云API

阿里巴巴发布开源模型Qwen3.8-27B,采用Apache 2.0许可,支持本地部署,无需云API即可运行前沿级编码Agent和推理任务。该模型拥有270亿参数,支持原生图像和视频理解,上下文窗口达262,144个token,并具备可配置推理能力,适用于编码和Agent工作流。在硬件需求上,全精度运行约需56GB显存,FP8版本约28GB,4-bit量化后更低,适合消费级GPU。开发者可在Hugging Face下载权重,这一发布被视为对本地AI生态的重要推动。

来源:VentureBeat AI·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

Mojo 编程语言正式开源,编译器与工具链采用 Apache 2 许可

Mojo 编程语言在发布 1.0 版本后,于本周正式开源,编译器与工具链采用 Apache 2 许可。Mojo 最初的目标是成为 Python 的超集,但后来调整了方向,现在定位为一种独立的语言,专注于让 GPU 编程尽可能简单,语法受 Python 启发,但不保证与现有 Python 代码完全兼容。团队表示,AI 辅助编码工具已经能帮助开发者将 Python 迁移到 Mojo,未来工具链和生态的成熟将使这一过程更加顺畅。对于 AI 开发者而言,Mojo 的开源意味着可以更自由地使用和定制这一高性能语言,特别是在需要 GPU 加速的 AI 工作负载中。

来源:Simon Willison·原文

画布如何让 Agent 工作流可见、可操控且成本高效

GitHub 博客发布文章,探讨如何利用画布(canvases)使 Agent 工作流更加可见、可操控且成本高效。文章指出,聊天界面适合表达意图,但 Agent 的工作过程容易在滚动中丢失。通过画布,开发者可以直观地看到 Agent 的每一步操作,从而更好地进行监督和调整。文章还介绍了在 GitHub Copilot 中使用画布的具体方法,并强调了画布在提高开发效率、减少错误方面的价值。对于 AI 开发者而言,画布提供了一种新的交互范式,有助于构建更透明、更可控的 Agent 应用。

来源:GitHub Blog·原文

研究揭示多跳检索基准的“商业税”:许可与成本盲点

一篇 arXiv 论文指出,当前多跳检索系统的基准测试忽略了两个关键事实:检索骨干是否可商用部署,以及构建成本。研究发现,领域内的密集检索锚点 NV-Embed-v2 采用 CC-BY-NC 4.0 许可,而四个领先的 MuSiQue 系统中有三个依赖它取得最佳成绩,但未明确说明。性能方面,在相同测试条件下,最佳商用许可嵌入器比锚点落后 2.31 个 Recall@5 点。直到 2026 年中期,这种“商业税”一直存在,但 NVIDIA 的 Nemotron-3 等新模型可能正在改变这一局面。

来源:arXiv cs.CL·原文

85% 因 AI 失误受损的企业正加速裁减能发现错误的人类

VentureBeat 的 VB Pulse 调查显示,曾因 AI Agent 通过评估但在生产中失败而受损的企业,正加速将人类从部署决策中移除,而非放慢速度。7 月,108 家企业中 13% 表示信任自动化评估,高于上月的 5%。同时,认为测试与现实结果不一致是最大问题的受访者比例从 29% 降至 19%。然而,49% 的受访者表示,通过公司测试的 AI 功能曾对客户造成问题,24% 表示这种情况发生过多次。这表明企业在追求效率的同时,可能忽视了人类监督的价值。

来源:VentureBeat AI·原文

8月29日工作坊:用开源模型端到端构建并评测生产级RAG

AI顾问兼Chelsea AI Ventures创始人Ben Auffarth宣布,将于8月29日举办一场动手工作坊,全程使用开源模型、不调用任何API,端到端构建并评测生产级检索增强生成(RAG)系统。工作坊覆盖混合检索(向量加关键词,而非仅向量)、重排序以捕捉向量搜索遗漏的相关块、使用RAGAS进行质量评估以确保改进可量化、从设计阶段内置护栏,以及针对开源模型部署的实际成本与性能基准测试。该工作坊面向希望在生产环境中落地RAG的开发者,强调可复现的评测方法和成本考量,对优化检索质量与部署决策具有直接参考价值。

来源:Reddit Machine Learning·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

双编码器模型绑定能力极限的数学解释

arXiv 最新论文《The Limits of Binding in Dual Encoders》对 CLIP 这类双编码器模型在“绑定”任务上的失败给出了数学解释。这类模型通过两个独立单位向量的内积来匹配图像与文本,但在区分“红色汽车和蓝色狗”与“蓝色汽车和红色狗”时,得分往往接近随机。研究在理想编码器框架下证明,相关公理可满足,因此不可能性必然来自额外可检验的假设。论文给出了三个障碍,其中递归角色绑定编码的交换余量满足精确定律 m(D)=2b^{-D},可解析深度随维度仅对数增长,在 CLIP 规模下仅为个位数。该工作为理解多模态模型的结构性局限提供了理论依据。

来源:arXiv cs.CL·原文

RecurrentGPT:通过循环调制提升 Transformer 表达深度

新论文提出 RecurrentGPT,一种循环深度 Transformer,旨在解决扩展语言模型时表达力与内存效率之间的固有矛盾。传统每层独立权重虽能保留功能特化,但内存占用大;而标准深度共享则强制统一变换,降低表示多样性。RecurrentGPT 采用固定深度的前奏和尾声块,中间共享一个核心块并迭代 R 次,受门控循环神经网络启发,使用轻量投影和元素级更新门,根据隐藏状态、前奏输出和每步重采样的噪声来调制循环更新。该方法在保持内存效率的同时,允许模型对输入进行特化处理,为高效深度模型设计提供了新思路。

来源:arXiv cs.CL·原文

AffectLoop:多模态情感动态感知的共情社交机器人

论文介绍 AffectLoop,一个在 Misty II 机器人上实现的多模态说话者-倾听者情感动态感知口语对话系统。现有共情对话系统多以文本为中心,将共情建模为用户情感到系统响应的单向映射,难以捕捉具身的说话者-倾听者情感交流。AffectLoop 跟踪说话者的言语和面部情感动态,估计机器人倾听者自身的言语和行为情感状态,并基于两种情感流条件化 LLM 响应生成。该系统旨在让社交机器人不仅响应用户所说内容,还响应用户情感在交互中的动态变化,为具身共情 AI 的发展提供了新的技术路径。

来源:arXiv cs.CL·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

Perplexity免费AI套餐在印度带来数百万新用户,收入增长60%

据TechCrunch报道,Perplexity与Airtel合作在印度推出免费AI套餐,吸引了大量新用户。尽管套餐结束后应用下载量有所下降,但Perplexity在印度的收入仍增长约60%。这表明免费策略成功将用户转化为付费用户,并提升了品牌认知度。通过电信运营商渠道触达更广泛的用户群体,这一模式或可为其他新兴市场提供参考。对AI搜索公司而言,与本地运营商合作可能是获取用户和实现商业化的有效路径。

来源:TechCrunch AI·原文

Stripe以70亿美元收购OpenRouter,加速AI基础设施布局

据Latent Space报道,支付巨头Stripe已同意以70亿美元收购AI模型路由平台OpenRouter,交易预计在90天内完成。OpenRouter目前年化收入约1.4亿美元,毛利率约70%,年化毛利润约1亿美元,成本仅占收入的28.5%。该平台每月处理250万亿token,较2月份的50万亿增长5倍,拥有800万开发者用户。此次收购将使Stripe获得强大的AI基础设施和开发者网络,或进一步整合支付与AI服务,推动AI应用的商业化进程。

来源:Latent Space·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

Flock 平台更新引发争议:警方监控技术的边界何在?

美国警方技术公司 Flock 在全美部署了约 12 万个自动车牌读取器。近期,该公司宣布平台更新,旨在防止警察将这些设备用于非法或不正当用途,包括跟踪骚扰。此前《华盛顿邮报》报道了 50 起警察滥用 Flock 及其竞争对手系统的案例,其中一名威斯康星州女性指控其警察前男友曾 179 次搜索她的车辆。批评者认为,这些更新不足以解决根本问题,警方监控技术的滥用风险依然存在。这一事件凸显了 AI 监控技术在执法领域的伦理与监管挑战,如何平衡公共安全与个人隐私成为亟待解决的议题。

来源:MIT Technology Review AI·原文

新研究提出基于上下文的评分方法,评估 AI 文本生成的价值与原创性

一篇 arXiv 论文提出了一种基于上下文的评分方法,用于评估神经文本生成的价值和原创性。该方法借鉴信息论,旨在激励模型在保持准确性和遵循指令的同时,偏离已学习的概率分布,从而增加输出的多样性。研究团队将该评分作为强化学习中的奖励信号,对大型语言模型进行微调,以提升其创造性表现。实验表明,该方法在多个任务上优于传统的温度采样策略,为解决 AI 生成内容缺乏多样性的问题提供了新思路。这项研究对创意写作、内容生成等应用具有潜在价值,也为 AI 系统的创造性评估提供了量化工具。

来源:arXiv cs.CL·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Nikunj Kothari(投资人):AI 全行业都没有护城河,除了风投公司

Nikunj Kothari 在 X 上列出一长串“没有护城河”的名单:模型层(OpenAI、Anthropic、xAI)、IDE(Cursor、Windsurf)、harness 层(Cognition、Factory、LangChain)、应用构建器(Replit、Lovable、Bolt)、包装器(Harvey、Abridge、OpenEvidence)、推理提供商(Together、Fireworks、Groq)、语音层(Sierra、Decagon、ElevenLabs)、数据标注(Scale、Surge、Mercor)、AI 基础设施(Baseten、Modal、Railway)、neocloud(CoreWeave、Lambda、Crusoe)以及生成式媒体公司(Runway、Higgsfield、Suno)。他讽刺地总结:似乎整个 AI 行业都没有护城河,除了风投公司。这条观察提醒创业者和投资人,在 AI 领域构建可持续壁垒的难度极高,资本和速度可能比技术本身更重要。

来源:Follow Builders·原文

Boris Cherny(工程师):小而美的体验改进会累积成产品优势

Boris Cherny 在 X 上分享了他对 AI 产品与工程的观察,强调“像这样的小型生活质量改进会累积起来,更多改进正在路上”。虽然他未指明具体产品,但这一观点指向一个普遍规律:在 AI 产品竞争激烈的当下,单个功能的大创新固然重要,但持续打磨细节、优化用户体验的微小改进,往往能形成长期的产品差异化和用户忠诚度。对 AI 产品经理和开发者而言,这提醒我们不要只盯着模型能力,也要重视交互细节、响应速度、错误处理等‘看不见’的工程优化,这些点滴积累最终会反映在留存和口碑上。

来源:Follow Builders·原文

Peter Yang(产品人):用免费订阅引导沉淀 AI 产品读者

Peter Yang 在 X 上推广其 newsletter,称已有超过 11 万订阅者,邀请读者免费获取他的 AI 与产品指南。虽然这是自我推广,但背后反映了一个 AI 产品实践中的常见策略:通过免费内容吸引目标用户、建立信任与影响力,再逐步转化为付费或深度用户。对于 AI 创业者,这提示了内容营销和社区运营在冷启动中的价值——在模型能力趋同的背景下,高质量的教育内容和持续输出,可以成为获取早期用户和构建品牌认知的有效手段。

来源:Follow Builders·原文

Josh Woodward(Google VP):Gemini 体验改进路线图曝光,Workspace 工具即将改版

Google VP Josh Woodward 在 X 上回应社区反馈,公布了 Gemini 的体验改进路线图:1-2 周内测试改版后的 Workspace 工具;3.7 Flash 的工具调用已有改进,后续会继续优化;新的“Projects”设计已完成,正在实现中;现已支持 49 个连接器;后端工作完成,前端工作已启动;多项优化已完成,并修复了最大的过度触发 bug。这些细节展示了 Google 如何根据用户反馈快速迭代,对 AI 产品经理和开发者有参考价值:重视反馈、明确优先级、快速交付,是提升 AI 产品体验的关键。

来源:Follow Builders·原文

Swyx(Latent Space 联合创始人):Trajectory 在持续学习上的工程取舍值得借鉴

Swyx 对 Trajectory 团队在宏大目标上的克制执行印象深刻。在持续学习(Continual Learning)方向上,Rronak 的分享清晰展示了他们如何解决剩余的数据问题:仅靠 GRPO 不够,必须转向 on-policy 方法,并逐一修复随之而来的各种问题。Swyx 认为这是该领域早期领导者给出的精彩概述,对做 Agent 训练和模型迭代的团队很有参考价值。

来源:Follow Builders·原文