论文提出音频描述全局优化框架,把“说什么、何时说、怎么说”联合决策
arXiv 新论文把音频描述(AD)生成形式化为一个受约束的全局优化问题。现有自动 AD 系统多把任务当作局部视频转文本,默认要描述的内容和出现时间已经给定;但真实场景需要同时决定哪些视觉信息对叙事重要、哪些时间空隙不打断对白、以及如何在有限时长内压缩表达。 作者构建了一套混合系统:先用大语言模型提出并定位视觉元素、估计其叙事显著性并生成压缩表述,再用混合整数线性规划在约束下求解。这项工作把无障碍内容生成从“逐帧描述”推进到“整片排程”,对视频理解、长上下文规划与多模态代理的任务调度也有方法层面的参考价值。