AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

TL;DR

AStar以思维卡片免训练增强多模态推理,在MathVerse达53.9%。

cs.CL 🔴 高级 2025-02-04 32 次浏览
Jinyang Wu Mingkuan Feng Guocheng Zhai Shuai Zhang Zheng Lian Fangrui Lv Pengpeng Shao Ruihan Jin Zhengqi Wen Jianhua Tao
多模态推理 测试时推理 思维卡片 MCTS 结构化思考

核心发现

方法论

AStar是免训练的Automatic Structured Thinking框架。它先用500个种子样本和Monte Carlo Tree Search(MCTS)生成推理路径,再将路径抽象为思维卡片。卡片由六类视觉语言动作构成:Visual Parsing、System Analysis、One-Step Thought、Chain-of-Thought、Divide and Conquer、Self-Reflection。测试时依据问题复杂度(PC)和图文语义(TIS)检索五张卡片,生成候选解,并以自洽性与文本奖励模型验证。

关键结果

  • 在MathVerse上,AStar搭配Qwen2.5-7B达到53.9%,超过GPT-4o的50.2%、URSA-8B的45.7%和R1-VL-7B的40.0%;在MathVision上达到32.7%,超过GPT-4o的30.4%。
  • 方法具有跨域迁移能力:GPT-4o结合AStar在MMMU上由70.3%升至73.2%,在GAOKAO-MM上由47.8%升至52.2%;Qwen2-VL-2B在GAOKAO-MM达到44.3%,基线为35.3%。
  • 效率显著提升:仅需0.5K先验样本和50分钟预处理,无参数更新;相较Mulberry的260K样本和URSA的1100K样本,数据量分别减少520倍和2200倍。

研究意义

AStar缓解了多模态模型在复杂视觉推理中的三重瓶颈:显式搜索计算昂贵、监督微调需要大规模高质量数据、强化学习存在探索深度与训练稳定性问题。它证明高层推理策略可以像外部“程序”一样在测试时调用,而不必重新训练模型。对学术界而言,该框架提供了研究隐式能力与显式策略协同的新视角;对产业而言,它适合资源受限、模型需快速迭代的视觉问答与文档分析系统。

技术贡献

核心贡献包括:用MCTS和UCT系统探索种子问题的推理轨迹;用Value of Computation思想以Score=kR-(1-k)C平衡答案奖励与动作成本;依据PC与CLIP图文表示TIS建立轻量卡片库;通过排名融合自适应选择五张卡片;用自洽投票和结果奖励完成验证。与逐题MCTS相比,测试阶段不再搜索庞大解空间;与SFT、PPO、GRPO相比,不改变模型参数且可组合。

新颖性

新颖性不在于单独使用MCTS、CoT或检索,而在于把少量样本中的搜索轨迹压缩为可复用、可匹配的高层动作模板,并在测试时动态实例化。多数方法要么逐题显式探索,要么通过大规模后训练将策略隐式写入参数;AStar在两者之间建立了轻量的外部策略记忆。

局限性

  • 思维卡片仍依赖种子数据质量与MCTS预处理;复杂或分布外任务若没有相近卡片,检索可能失配。
  • 视觉域缺少可靠验证器,论文使用自洽性和文本奖励模型,可能无法识别图像读取错误或几何推理错误。
  • 每题生成五条候选轨迹会增加测试时推理开销,且卡片抽象质量与超参数k、动作深度有关。

未来方向

未来可构建视觉专用验证器,学习更细粒度的卡片表示与动态卡片数量;研究跨语言、视频和真实世界代理任务中的迁移;进一步压缩候选轨迹,降低测试时延。还可将AStar与SFT、PPO、GRPO联合优化,形成参数化能力与外部策略库协同的推理系统。

AI 总览摘要

多模态大模型已经能够识别图像并回答简单问题,却常在数学图形、图表和复杂视觉问答中失误。现有路线通常采用Beam Search或MCTS逐步探索,但解空间巨大;或使用SFT、PPO、GRPO进行后训练,却需要大量数据、算力和稳定的奖励设计。AStar提出一种不改参数的测试时方案,试图以更小成本获得更有条理的思考。

该方法的关键是“思维卡片”。研究者先用500个种子样本运行MCTS,以UCT选择节点、扩展动作并反向传播奖励,再用Score=kR-(1-k)C挑选兼顾正确率和长度的路径。路径随后被压缩成六种基本动作的高层模板,例如Visual Parsing→System Analysis→Chain-of-Thought。面对新问题,AStar依据问题复杂度和CLIP图文语义检索五张卡片,生成候选答案,并通过自洽性和奖励模型验证。

实验显示,Qwen2.5-7B配合AStar在MathVerse达到53.9%,超过GPT-4o的50.2%;在MathVision达到32.7%,超过GPT-4o的30.4%。它只需0.5K样本和50分钟预处理,并能迁移到MMMU、GAOKAO-MM和MMStar。局限在于验证器仍不够视觉化,且五路候选会增加推理成本。总体而言,AStar将昂贵的逐题搜索转化为可复用的策略记忆,为小模型和资源受限研究提供了实用路径。

深度分析

研究背景

MLLM从LLaVA、InternVL到Qwen2-VL不断增强,但复杂视觉推理仍需要System 2式分解和复核。OpenAI-o1、DeepSeek-R1推动了长CoT;Mulberry采用搜索,URSA、R1-VL和MM-Eureka采用SFT或RL。然而搜索成本高,后训练依赖15K至1100K级数据并可能不稳定。

核心问题

模型常直接预测,难以决定何时解析图像、拆分问题、展开长链或反思。逐题搜索会重复探索相似策略;后训练则将策略隐式写入参数,数据和算力成本高,也限制研究者获得能力。

核心创新

AStar将推理策略显式存入思维卡片。卡片不是完整答案,而是可迁移的动作模板,并附带问题复杂度和图文语义统计。其创新组合是:小规模MCTS负责发现策略,VOC式评分负责压缩策略,PC/TIS检索负责适配问题,验证模块负责筛选结果。

方法详解

  • �� 定义六个动作:VP、SA、OST、CoT、DC、SR。
  • �� 对种子问题运行MCTS;UCT(s)=Q(s)+w√(lnN(p)/N(s))平衡探索与利用。
  • �� 用叶节点自洽性作为奖励,并按Q(p)←(1-α)Q(p)+αQ(s)回传。
  • �� 以Score=kR-(1-k)C选择最优路径并抽象卡片。
  • �� 用PC和CLIP融合表示TIS=(EI(i)+ET(t))/2匹配卡片。
  • �� 取排名最优的五张卡片生成五条解,再以自洽性和文本奖励模型验证。

实验设计

实验覆盖数学推理MathVista、MathVerse、MathVision,通用推理MMMU,科学推理GAOKAO-MM,以及ChartQA、MMStar、BLINK。骨干包括Qwen2.5-7B、Qwen2-VL-2B/7B;对比Qwen2-VL、InternVL、URSA、Math-LLaVA、R1-VL、LMM-R1、MM-Eureka、Mulberry和GPT-4o。消融移除卡片、随机匹配及简化验证。

结果分析

AStar在MathVerse总体53.9%,视觉主导任务64.4%,逻辑推理59.5%;MathVision为32.7%。MMStar达到62.3%,高于Mulberry的61.3%。消融显示去除卡片后平均准确率由43.3%降至33.8%,去除匹配降至37.6%,说明策略内容和适配机制均重要。种子数从50增至500时平均成绩由33.5%升至43.3%。

应用场景

可用于图表问答、教育数学题、科学视觉问答、文档审阅和小模型部署。使用者需要一个可调用图像的MLLM、少量代表性样本及离线卡片构建过程;无需训练集扩展或参数更新,适合私有化和快速迭代。

局限与展望

方法仍需离线MCTS和五路测试时生成;PC估计与CLIP语义相似度未必能表达细致几何关系。文本奖励模型替代视觉验证器是明显假设。未来应发展视觉过程奖励、动态计算预算、可解释卡片编辑,并在视频、跨语言和真实交互环境验证鲁棒性。

通俗解读 非专业人士也能看懂

把AStar想成一家会做复杂订单的厨房。普通模型像只看一眼菜单就出菜的厨师,简单菜没问题,复杂菜容易漏步骤。传统搜索像每道菜都把所有做法重新试一遍,既慢又浪费;后训练像重新培训整家厨房,成本很高。

AStar先从500道旧订单中观察优秀厨师怎样做菜,再把经验写成“思维卡片”:先检查食材、再拆分步骤、需要时逐项处理、最后复查。遇到新订单时,它按照订单难度和食材描述,挑出五张最合适的卡片,而不是盲目尝试所有菜谱。随后厨师依据卡片完成几份候选菜,并比较结果是否一致。

因此,AStar不是把答案硬塞给模型,而是提供做题路线。它只需50分钟准备卡片,却让Qwen2.5-7B在MathVerse达到53.9%,超过GPT-4o的50.2%。

简单解释 像给14岁少年讲一样

想象你在玩解谜游戏。普通AI像看到机关就马上猜密码;简单关卡能过,复杂关卡就乱了。有人让AI把每条可能路线都试一遍,叫搜索,但地图一大就特别慢;也有人重新训练AI很久,像让它去上大量补习班。

AStar用了更聪明的办法:先让AI研究500道旧题,把常用的解谜套路写成小卡片。例如“先看清图片”“把大问题拆成小问题”“算完再检查”。碰到新题时,它根据题目难度和图片内容挑五张卡片,再分别尝试,最后选最可靠的答案。

它没有改变AI的大脑,也不用大量训练。Qwen2.5-7B加AStar在MathVerse拿到53.9%,超过GPT-4o的50.2%;在MathVision达到32.7%。更酷的是,数学套路还能帮助科学题和图表题。

当然它不是魔法:如果卡片库里没有相似套路,选择可能不准;而且同时尝试五条路线会多花时间。下一步可以让AI拥有更好的“图片裁判”,专门检查图形和空间关系。

术语表

Thought Card(思维卡片)

把完整推理路径压缩成可复用的高层动作模板。它包含模板及其复杂度、图文语义特征。

AStar离线构建并在测试时检索。

MCTS(蒙特卡洛树搜索)

通过选择、扩展、模拟和反向传播探索决策树。它用奖励估计不同推理步骤的价值。

用于500个种子问题生成高质量路径。

UCT(树上置信上界)

在探索新节点和利用高价值节点之间权衡的选择公式。论文公式为Q(s)+w√(lnN(p)/N(s))。

MCTS的节点选择阶段。

PC(问题复杂度)

由输入图像和文本估计的任务难度特征。它帮助系统寻找难度相近的卡片。

与TIS共同用于卡片匹配。

TIS(图文语义)

由CLIP图像与文本编码融合得到的联合语义表示。论文定义为(EI(i)+ET(t))/2。

用于比较测试题和卡片的语义相似性。

开放问题 这项研究留下的未解疑问

  • 1 视觉奖励模型仍不成熟,文本奖励与自洽性可能无法发现图像读取、几何关系或图表定位错误。
  • 2 卡片跨领域迁移虽有效,但尚不清楚哪些抽象结构真正可迁移,以及何时会因领域差异而失效。
  • 3 五条候选轨迹的收益与延迟之间如何动态权衡,仍需要更系统的计算预算研究。

应用场景

近期应用

教育数学与图表辅导

教育平台可用少量历史题构建卡片,让7B级模型先解析图形、拆题并复核,再生成答案。无需重新训练,适合题库更新频繁和本地部署场景。

科学文档视觉问答

研究机构可将卡片用于论文图表、实验装置和统计图解释。Qwen2-VL等开源模型即可接入,离线准备约50分钟,便于隐私敏感环境使用。

远期愿景

可组合的多模态推理操作系统

未来可把思维卡片扩展为跨语言、视频和机器人任务的策略库,由模型按风险和预算动态调用,连接参数化知识与外部可编辑推理程序。

原文摘要

Multimodal large language models excel across diverse domains but struggle with complex visual reasoning tasks. To enhance their reasoning capabilities, current approaches typically rely on explicit search or post-training techniques. However, search-based methods suffer from computational inefficiency due to extensive solution space exploration, while post-training methods demand substantial data, computational resources, and often exhibit training instability. To address these challenges, we propose \textbf{AStar}, a training-free, \textbf{A}utomatic \textbf{S}tructured \textbf{t}hinking paradigm for multimod\textbf{a}l \textbf{r}easoning. Specifically, we introduce novel ``thought cards'', a lightweight library of high-level reasoning patterns abstracted from prior samples. For each test problem, AStar adaptively retrieves the optimal thought cards and seamlessly integrates these external explicit guidelines with the model's internal implicit reasoning capabilities. Compared to previous methods, AStar eliminates computationally expensive explicit search and avoids additional complex post-training processes, enabling a more efficient reasoning approach. Extensive experiments demonstrate that our framework achieves 53.9\% accuracy on MathVerse (surpassing GPT-4o's 50.2\%) and 32.7\% on MathVision (outperforming GPT-4o's 30.4\%). Further analysis reveals the remarkable transferability of our method: thought cards generated from mathematical reasoning can also be applied to other reasoning tasks, even benefiting general visual perception and understanding. AStar serves as a plug-and-play test-time inference method, compatible with other post-training techniques, providing an important complement to existing multimodal reasoning approaches.

cs.CL