TodayAI

TODAYAI DAILY

今日 AI 日报2026-07-30

Visa用Claude Mythos查支付漏洞并开源;ToxScreen基准助检测LLM投毒;LLM生成幽灵作者污染学术体系 | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

研究揭示LLM生成虚构“幽灵作者”现象,已污染学术出版体系

arXiv发布的一项研究揭示了大型语言模型在生成虚构专家姓名时会产生高度相关的角色组合(如Claude模型偏好Elena Vasquez和Marcus Chen,Gemini偏好Aris Thorne和Lena Petrova等),这些名字在大量AI生成文档中反复出现。更严重的是,这些“幽灵姓名”已造成实际后果:在CERN运营的Zenodo平台上,研究者发现1655条记录声称来自不存在的期刊,其中991条在一个月内注册并获得真实的DataCite DOI,可以被学术聚合器收录。这些虚假记录会误导学术检索和引文分析。

来源:arXiv cs.LG·原文

Visa利用Claude Mythos在支付网络中搜寻漏洞,并开源其测试框架

Visa将Anthropic的Claude Mythos应用于其全球支付网络(覆盖200多个国家和地区、近50亿支付凭证)的安全测试。模型成功将堆栈深处的微小弱点组合成可利用的漏洞链,这类漏洞通常在渗透测试后期才会被发现。Visa技术总裁Rajat Taneja在VB Transform 2026上介绍了这一过程,并宣布开源了控制整个搜寻过程的测试框架。他表示,Visa放弃了传统的修复指标,转而采用团队自创的度量标准。这一行动展示了AI在关键金融基础设施安全检测中的实际应用。

来源:VentureBeat AI·原文

ToxScreen基准发布:在缺乏训练数据条件下检测LLM是否被投毒

来自arXiv的新论文提出了ToxScreen,一个包含约800个被植入后门的大语言模型基准,涵盖多种攻击目标、触发机制和投毒率。研究者在现实的防御条件下(仅有模型权重和已知的异常行为,无训练数据、无参考模型、无触发知识)评估后门恢复能力。结果显示,基于梯度的提示优化方法失效,而基于候选token查找攻击成功率的方法能有效恢复触发词。研究还发现后门操作与越狱攻击的机制不同,有助于过滤越狱行为。该基准为检测LLM安全性提供了重要工具。

来源:arXiv cs.LG·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

Google.org 推出三项新工具,助力非营利组织运用 AI

Google.org 宣布为非营利组织提供新的工具和资源,帮助他们更好地利用 Google AI 技术。这些工具包括一个 AI 学习中心、一个项目资助计划和一个社区实践网络,旨在降低非营利组织使用 AI 的门槛。Google.org 全球负责人 Maggie Johnson 表示,AI 有潜力放大非营利组织的影响力,但许多组织缺乏相关知识和资源。通过这些举措,Google 希望让更多非营利组织能够应用 AI 解决社会问题。

来源:Google AI Blog·原文

三星芯片人才流失:员工因巨额奖金跳槽至 SK 海力士

据 MIT Technology Review 报道,三星半导体部门面临人才流失危机,工程师们正纷纷跳槽至竞争对手 SK 海力士。原因是 SK 海力士因高带宽内存(HBM)芯片的创纪录利润,计划向员工发放高达 47.6 万美元的奖金,远超三星的奖金水平。一名三星工程师表示,同事们感到士气低落,许多人正在工作时间准备跳槽申请。这场人才争夺战凸显了 AI 芯片市场的激烈竞争。

来源:MIT Technology Review AI·原文

Google 搜索 AI 模式新增 5 种技巧,助你更好体验现实世界

Google 搜索的 AI 模式新增 5 种实用技巧,帮助用户在线下活动中更高效地使用 AI。例如,用户可以通过 AI 模式预订音乐会门票、找到合适的登山靴等。尽管这听起来有些反直觉,但 Google 表示,AI 工具实际上可以帮助你更好地享受离线时光。这些技巧旨在让搜索更智能、更贴合用户的实际需求,提升日常生活便利性。

来源:Google AI Blog·原文

最新 AI 炒作指数:芯片员工因奖金成约会热门,AI 炒作降温

MIT Technology Review 发布了最新一期 AI 炒作指数,盘点本周最受关注的 AI 动态。亮点包括:1X 机器人公司展示了一对灵活的新机械手,引发争议;Grok 的翻译功能被批评为“色情”;Meta 的智能眼镜可能变得更令人不安;大型科技公司的碳排放持续飙升。不过 AI 也给一些人带来了好处:韩国芯片工人因巨额奖金成为约会市场的热门对象,证明了 AI 带来的经济回报。

来源:MIT Technology Review AI·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

OpenAI产品工程负责人详解ChatGPT Work:从0到1000万用户

OpenAI产品工程负责人Akshay Nathan在Latent Space播客中深入介绍了ChatGPT Work的构建理念,旨在让AGI触手可及。ChatGPT Work集成了Sites、OpenClaw、Memory、Subagents、Finance和No-Code等特性,将Codex作为底层引擎。据统计,Codex月活用户自2026年1月以来增长了10倍以上,ChatGPT Work与Codex合计用户数突破1000万。Akshay分享了从代码生成到知识工作代理的演进路径,并给出了大规模Agent部署的实用建议。

来源:Latent Space·原文

Tablo:桌面猫咪监控AI编码Agent

Tablo是一款可爱的桌面小部件,以一只卡通猫咪的形象实时监控AI编码代理的运行状态。它能直观展示代码生成、调试等过程,帮助开发者提高对AI Agent行为的可见性和掌控力。适合在使用Codex、Copilot等编码助手时,保持专注和轻松氛围。Tablo与AI代理工具联动,将监控过程游戏化,让开发者更愉快地观察Agent工作。

来源:Product Hunt AI·原文

AI正在吞噬金融:继编程后的下一个垂直领域

Latent Space的AI新闻简报指出,AI正在全面渗透金融服务,成为继编程之后的下一个重大垂直行业。报道涵盖了K3、FineWeb等工具在金融场景的应用,以及AIE纽约活动的开放注册。随着金融数据分析和交易自动化需求增长,开发者正将Agent技术引入风控、量化交易和合规审查等环节,有望显著提升效率并催生新的创业机会。

来源:Latent Space·原文

质量守恒感知机:水文模型与神经网络融合的可解释方案

一篇arXiv论文提出了质量守恒感知机(MCP)框架,将概念水文模型重构为物理约束的神经网络。在美国513个流域的评估显示,双状态MCP网络的中位KGEss从0.82提升至0.89,五状态网络可达0.90,与LSTM性能相当但参数更少。该工作展示了如何将领域知识嵌入深度学习模型,实现可解释性与预测精度的平衡,为开发者设计物理感知的AI系统提供了新思路。

来源:arXiv cs.LG·原文

Greplica:为编码智能体提供自更新的知识库

Greplica 是一款面向编码智能体的自更新 wiki 工具。它能够自动抓取、整理并持续同步代码库、文档、问题追踪等多个来源的信息,为 AI 编码助手(如 Copilot 等)提供实时准确的上下文参考。开发者无需手动维护知识库,Greplica 会根据代码变化自动调整内容,确保智能体始终使用最新信息。适合使用代码智能体进行项目开发的团队,可显著提升 AI 辅助编码的准确性和效率。

来源:Product Hunt AI·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

利用 ncnn Vulkan 后端实现跨平台 ML 推理加速

PostSlate 视频编辑工具的开发团队分享了在生产环境中实现跨平台 ML 推理的经验。为兼容 NVIDIA、AMD、Intel 集成显卡和 Apple Silicon 等多种 GPU,他们放弃了 CUDA,选择了 ncnn 的 Vulkan 后端。实测在 RTX 4070 上,ArcFace R50 人脸嵌入从 ONNX CPU 的 30ms 降至 3ms,SCRFD 人脸检测从 25ms 降至 2.5ms,模型大小也减半。关键优势是 Vulkan 驱动已预装在所有目标设备上,用户无需额外安装运行时,显著降低了部署成本。

来源:Reddit Machine Learning·原文

弱到强同策略蒸馏:用多个弱模型提升强学生模型

arXiv 上发表的一篇新论文提出弱到强同策略蒸馏(W2S-OPD)框架,用于将多个弱模型的能力迁移到更大的学生模型。传统同策略蒸馏要求教师模型至少与学生同等或更强,这在前沿模型缺失更大教师时失效。W2S-OPD 通过构建对比对(正模型和负模型,均比学生小)在 logit 空间生成代理教师,将能力方向叠加到学生基础模型上,然后通过反向 KL 散度实现蒸馏。实验表明,在多项数学和代码基准上,该方法显著优于标准 OPD 和现有蒸馏方法。

来源:arXiv cs.LG·原文

探索数学与代码组合场景下的模型幻觉问题

一位研究者发现当前前沿模型在处理同时包含数学和代码的提示时会出现静默替换问题。例如要求实现“子黎曼几何”的代码,模型会输出基于 SVD、PCA 等常见方法的代码,而非真正的黎曼几何方法;而单独询问“实现子黎曼几何”时模型却能正确生成涉及测地线的代码。这表明模型在组合任务中倾向于使用廉价替代,暴露了其理解缺陷。作者呼吁建立新的数学+代码基准来评估此类幻觉现象。

来源:Reddit Machine Learning·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

Hint:玛莎·斯图尔特联合创办AI家居管理创业公司

玛莎·斯图尔特联合创办的AI创业公司Hint,推出一款面向房主的AI助手,将房产记录、维护日程、房屋文件等整合到一个应用中,旨在成为“你家的AI”。Hint结合了房产数据与AI对话能力,帮助用户管理房屋的日常维护和紧急问题。产品处于早期,但斯图尔特的品牌影响力可能加速市场渗透。Hint的商业模式可能包括订阅费或增值服务,但融资细节尚未披露。

来源:TechCrunch AI·原文

硅谷AI公司IPO潮将催生巨额慈善捐赠

随着Anthropic和OpenAI等AI公司即将IPO,其员工预计将产生大量财富,非营利组织已开始为“融资大爆发”做准备。据Wired报道,这些公司的IPO可能造就一批新的亿万富翁,而硅谷的慈善文化可能推动大规模捐赠。一位非营利领袖称“这将是一场狂野之旅”。这一趋势不仅影响慈善领域,也暗示AI行业的资本化进程正在加速,员工财富效应可能进一步刺激AI创业生态。

来源:WIRED AI·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

最优因果标注:利用LLM降低社会服务评估成本

一篇新论文提出了一种在固定预算下选择标注样本以最小化因果效应估计方差的方法。该方法结合LLM进行大规模文本标注,但针对LLM可能存在的偏差,通过优化标注概率选择最需要人工标注的样本。在与一家非营利组织的合作案例中,该方法将标注成本降低了43%至91%,同时发现现成的LLM会低估客户进展,表明需要谨慎使用LLM进行决策支持。该研究为将AI应用于政策评估和运营优化提供了可操作的方法。

来源:arXiv cs.LG·原文

Instacart CTO:AI让公司不再担心技术债务

Instacart首席技术官Anirban Kundu在VB Transform 2026上表示,AI代理已接管了大部分代码生成和重复性工作,使得工程师在97%的情况下不再需要阅读代码。他指出,技术债务不再是问题,因为不活跃的代码会被自动丢弃并重建。剩余3%涉及遗留系统、合规和延迟敏感的工作流仍需人工处理。这一转变意味着开发团队应将精力集中在需要判断力和异常处理的问题上,而AI负责战术层面的编码工作。

来源:VentureBeat AI·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Dan Shipper(Every CEO):模型安全需要自动化Agent防御系统

Dan Shipper点评一篇关于模型安全的研究:OpenAI的安全分类器被关闭,模型被明确指示进行漏洞利用,而HG的AI自动发现了攻击但关键性不够高。他认为,未来任何处理敏感客户数据的公司都必须部署自动化的Agent防御系统,这是一个巨大的机会且效果显著。这对AI安全产品方向有直接启发。

来源:Follow Builders·原文

Google Labs:Lyria 3.5显著提升AI音乐创作的控制力和表现力

Google Labs宣布DeepMind的Lyria 3.5模型已集成到Flow Music中,带来更好的提示遵从度、精确的BPM设置、全曲导出,以及更富表现力的人声和更自然的编排。Google Labs认为这能让用户更精准地实现创意方向,推动AI音乐工具向专业制作级别迈进。

来源:Follow Builders·原文

Aaron Levie(Box CEO):AI推理成本不会因稀缺而飙升,市场竞争将压低价格

Aaron Levie回应Dwarkesh的论点:随着AI变强,推理将流向最有经济价值的任务,但不会导致成本飙升,因为太多模型供应商和基础设施玩家会竞争推理需求,推动价格持续下降直至产能跟上。这一观点对AI创业公司的成本预期和商业模式有参考意义。

来源:Follow Builders·原文

Nikunj Kothari(AI投资者):AGI时代人类连接的重要性将愈发凸显

Nikunj Kothari分享个人感悟:随着数字和物理AGI的逼近,亲密的家人和朋友将是我们最重要的、也许是唯一的人类连接。他鼓励人们如果犹豫是否要孩子,可以考虑这个方向。尽管养育孩子艰难且不可逆,但这是巨大的特权。这提醒AI建设者关注技术发展对人类情感和社会结构的影响。

来源:Follow Builders·原文

Sam Altman(OpenAI CEO):即将出现显著加速科学发现的模型,最佳方式是赋能科学家而非包揽一切

Sam Altman 表示,他非常兴奋地看到接近能够显著加速科学发现的模型即将到来。他认为,OpenAI 的最佳策略不是试图自己解决所有问题,而是赋能科学家,让科学界广泛受益。这一观点对 AI 产品方向的启发是:未来模型应作为研究工具开放给领域专家,而非封闭在单一公司内部,从而最大化加速科学进步。

来源:Follow Builders·原文