MamaBench与MamaRetrieval:评估母婴健康检索增强生成的新基准
研究团队发布了两个专门用于评估母婴、新生儿及生殖健康领域检索增强生成(RAG)系统的基准测试。MamaBench包含25949道来自七个专家来源的多选题、简答题和评分题,覆盖助产士日常遇到的医疗问答;MamaRetrieval则提供3185个临床查询与63650个指南语块的分级相关性标签(0-6分),采用细粒度评分规则区分“回答查询”与“仅相关”的语块。两个基准通过专家来源筛选、非二值相关性标注以及标签局限性说明(范围分类器一致性、前沿模型检查、池化完整性审计)确保评估可靠性。该工作填补了母婴健康领域没有公开语块级检索基准的空白,并为部署在设备端的医疗助手提供了标准评测工具。
语言模型对激活操纵的内生抵抗机制被揭示
研究发现大型语言模型在生成过程中能够自发抵抗任务不匹配的激活操纵,表现为显式重述(如“等等,那不对”)并继续沿正确主题生成,即使操纵扰动持续存在。研究人员将其命名为“内生操纵抵抗”(ESR)。利用稀疏自编码器潜在变量对Llama-3.3-70B进行激活操控时,显式ESR出现率为3.8%,较小模型(Llama-3、Gemma-2系列)显式形式较少。通过对比搜索识别出26个相关潜在变量,将其归零消融后多尝试率降低25%,随机潜在变量和保留提示对照验证了特异性。研究还发现ESR可通过元提示和合成自纠正示例微调被有意增强。该发现对AI安全具有双重意义:既可能增强模型对抗激活空间操纵的鲁棒性,也可能干扰有益的安全干预。
EdgeBench揭示:智能体在真实环境中学习遵循对数S形缩放规律
研究者分析了约38000小时智能体在134项真实世界任务中的交互数据,首次发现环境学习阶段的整体性能遵循对数S形缩放规律(R²=0.998)。随着模型代际更迭,智能体学习速度大约每三个月翻倍。该发现基于EdgeBench——一个包含134项超长周期真实世界任务的套件,覆盖科学发现、软件工程、组合优化、专业知识工作、形式数学和交互游戏等领域。每项任务需要至少12小时连续智能体操作,并提供多层次丰富反馈。该工作公开了51项任务,为理解后训练阶段的持续学习规律提供了关键实证。这一规律意味着,预训练之外的环境交互学习同样具有可预测的进展,对构建长期自主智能体具有指导意义。
SpecEyes:利用推测性感知与规划加速智能体多模态大模型
针对OpenAI o3、Gemini Agentic Vision等智能体多模态大模型因迭代调用视觉工具产生的“智能体深度”延迟问题,研究者提出SpecEyes框架。核心思路是让轻量级免工具多模态模型担任推测性规划器,预测执行轨迹,从而提前终止昂贵工具链而不牺牲准确率。引入基于答案可分性的认知门控机制量化模型自我验证置信度,无需真实标签。同时设计异构并行漏斗,利用小模型的无状态并发掩盖大模型的有状态串行执行,最大化系统吞吐量。在V* Bench、HR-Bench和POPE上的实验显示,SpecEyes在保持或提升准确率(最高+6.7%)的同时实现1.1至3.35倍加速,有效提升了智能体系统的并发服务能力。