TodayAI

资源库

推理 Papers

面向链式推理、测试时计算与复杂问题求解的研究论文。

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-AI · 2025

通过大规模强化学习激励模型形成可观察的长链推理行为。

deepseekrlreasoning
推理arXiv

OpenAI o3 and o4-mini System Card

OpenAI · 2025

OpenAI o3 与 o4-mini 系统卡,概述新一代推理模型的安全评估。

o3reasoningsafety
推理Technical Report

rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking

Xinyu Guan, Li Lyna Zhang 等 · 2025

研究小模型通过自进化深度思考掌握数学推理的方法。

mathsmall-modelself-evolve
推理arXiv

s1: Simple test-time scaling

Niklas Muennighoff, Zitong Yang 等 · 2025

提出简洁的测试时扩展方法,用有限样本激发更强推理表现。

test-time-computescalingreasoning
推理arXiv

Search-o1: Agentic Search-Enhanced Large Reasoning Models

Xiaoxi Li, Guanting Dong 等 · 2025

将智能体式搜索与大推理模型结合,增强复杂问题求解。

searchagentreasoning
推理arXiv

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang 等 · 2024

结合数学语料与强化学习方法,提升开源模型数学推理能力。

mathrldeepseek
推理arXiv

OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems

Chaoqun He, Renjie Luo 等 · 2024

提出奥赛级双语多模态科学问题基准,用于衡量高难度推理。

olympiadbenchmarkmultimodal
推理arXiv

OpenAI o1 System Card

OpenAI · 2024

OpenAI o1 系统卡,概述推理模型的安全评估、能力边界与风险。

o1reasoningsafety
推理Technical Report

ProcessBench: Identifying Process Errors in Mathematical Reasoning

Chujie Zheng, Zhenru Zhang 等 · 2024

提出识别数学推理过程错误的评测基准 ProcessBench。

processbenchmathevaluation
推理arXiv

Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking

Eric Zelikman, Georges Harik 等 · 2024

让模型在生成前学习内化推理痕迹,提升后续回答质量。

self-taughtreasoninglatent
推理arXiv

Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Charlie Snell, Jaehoon Lee 等 · 2024

研究测试时计算扩展相对参数扩展在推理任务上的有效性。

test-time-computescalingreasoning
推理arXiv

Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Jason Wei, Xuezhi Wang 等 · 2022 · NeurIPS 2022

提出思维链提示,通过显式中间推理步骤提升大模型复杂推理表现。

chain-of-thoughtreasoningprompting
推理arXiv

Large Language Models are Zero-Shot Reasoners

Takeshi Kojima, Shixiang Shane Gu 等 · 2022 · NeurIPS 2022

展示简单零样本思维链提示即可显著提升大模型推理表现。

zero-shotchain-of-thoughtreasoning
推理arXiv

Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Wenhu Chen, Xueguang Ma 等 · 2022 · TMLR

用程序表达推理中的计算步骤,将数值计算与语言推理解耦。

program-of-thoughtsmathprompting
推理arXiv

Self-Consistency Improves Chain of Thought Reasoning in Language Models

Xuezhi Wang, Jason Wei 等 · 2022 · ICLR 2023

通过采样多条推理路径并投票一致性答案,提升思维链推理稳定性。

self-consistencychain-of-thoughtreasoning
推理arXiv

STaR: Bootstrapping Reasoning With Reasoning

Eric Zelikman, Yuhuai Wu 等 · 2022 · NeurIPS 2022

通过自举生成推理轨迹并迭代微调,提升模型推理能力。

self-taughtbootstrappingreasoning
推理arXiv

Measuring Mathematical Problem Solving With the MATH Dataset

Dan Hendrycks, Collin Burns 等 · 2021 · NeurIPS 2021

提出覆盖竞赛数学问题的 MATH 基准,用于评估复杂数学推理。

mathbenchmarkevaluation
推理arXiv

Show Your Work: Scratchpads for Intermediate Computation with Language Models

Maxwell Nye, Anders Johan Andreassen 等 · 2021

研究让语言模型在草稿区写出中间计算步骤以提升多步求解。

scratchpadreasoningcomputation
推理arXiv