研究:本地工具调用评测可能把服务层问题误判为模型能力不足
一篇新论文研究本地推理服务栈如何影响编码 Agent 的工具调用评测。论文指出,编码 Agent 必须先输出符合 schema 的可解析工具调用,执行框架才能执行动作,而这一协议步骤会受到服务层影响,测量结果未必只反映模型行为。在 Ollama 中,默认的 tools 请求由按模型预设的静态模板标志控制:部分模型被接受并以文本形式返回调用,部分返回原生 tool_calls,而 Phi-3 与 Gemma-3 在推理前即被拒绝。该评测框架没有把拒绝和重试耗尽保留为结构化失败元数据,下游分析可能把它们误判为模型未发起调用,从而得出 0% 保真度的结论;在保留原生通道的同时加入文本工具列表,可以恢复大部分被低估的指标。这提示团队在比较本地模型工具调用能力时,需要先区分服务栈限制与模型本身缺陷。