资源库
推理 Papers
面向链式推理、测试时计算与复杂问题求解的研究论文。
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
DeepSeek-AI · 2025
通过大规模强化学习激励模型形成可观察的长链推理行为。
OpenAI o3 and o4-mini System Card
OpenAI · 2025
OpenAI o3 与 o4-mini 系统卡,概述新一代推理模型的安全评估。
rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking
Xinyu Guan, Li Lyna Zhang 等 · 2025
研究小模型通过自进化深度思考掌握数学推理的方法。
s1: Simple test-time scaling
Niklas Muennighoff, Zitong Yang 等 · 2025
提出简洁的测试时扩展方法,用有限样本激发更强推理表现。
Search-o1: Agentic Search-Enhanced Large Reasoning Models
Xiaoxi Li, Guanting Dong 等 · 2025
将智能体式搜索与大推理模型结合,增强复杂问题求解。
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Zhihong Shao, Peiyi Wang 等 · 2024
结合数学语料与强化学习方法,提升开源模型数学推理能力。
OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems
Chaoqun He, Renjie Luo 等 · 2024
提出奥赛级双语多模态科学问题基准,用于衡量高难度推理。
OpenAI o1 System Card
OpenAI · 2024
OpenAI o1 系统卡,概述推理模型的安全评估、能力边界与风险。
ProcessBench: Identifying Process Errors in Mathematical Reasoning
Chujie Zheng, Zhenru Zhang 等 · 2024
提出识别数学推理过程错误的评测基准 ProcessBench。
Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking
Eric Zelikman, Georges Harik 等 · 2024
让模型在生成前学习内化推理痕迹,提升后续回答质量。
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
Charlie Snell, Jaehoon Lee 等 · 2024
研究测试时计算扩展相对参数扩展在推理任务上的有效性。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Jason Wei, Xuezhi Wang 等 · 2022 · NeurIPS 2022
提出思维链提示,通过显式中间推理步骤提升大模型复杂推理表现。
Large Language Models are Zero-Shot Reasoners
Takeshi Kojima, Shixiang Shane Gu 等 · 2022 · NeurIPS 2022
展示简单零样本思维链提示即可显著提升大模型推理表现。
Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks
Wenhu Chen, Xueguang Ma 等 · 2022 · TMLR
用程序表达推理中的计算步骤,将数值计算与语言推理解耦。
Self-Consistency Improves Chain of Thought Reasoning in Language Models
Xuezhi Wang, Jason Wei 等 · 2022 · ICLR 2023
通过采样多条推理路径并投票一致性答案,提升思维链推理稳定性。
STaR: Bootstrapping Reasoning With Reasoning
Eric Zelikman, Yuhuai Wu 等 · 2022 · NeurIPS 2022
通过自举生成推理轨迹并迭代微调,提升模型推理能力。
Measuring Mathematical Problem Solving With the MATH Dataset
Dan Hendrycks, Collin Burns 等 · 2021 · NeurIPS 2021
提出覆盖竞赛数学问题的 MATH 基准,用于评估复杂数学推理。
Show Your Work: Scratchpads for Intermediate Computation with Language Models
Maxwell Nye, Anders Johan Andreassen 等 · 2021
研究让语言模型在草稿区写出中间计算步骤以提升多步求解。