核心发现
方法论
论文把LLM优化视为迭代最大化问题,借鉴梯度下降,将反馈分为方向性、非方向性和仅奖励三类。核心算法Sequential Prompt Optimization由Agent、Prompt Proposal、Feedback Synthesizer与Prompt Selector组成;OptAgent从历史中的(o,r,f,p)提出新提示,并用期望奖励比较决定是否接受。
关键结果
- 在Booth、McCormick、Rosenbrock和Six-Hump Camel四个二维函数上,每种条件运行10次、最多10步。GPT-3.5和GPT-4加入方向性反馈后累计遗憾与最终遗憾均明显优于无反馈,并接近固定小学习率SGD。
- GPT-4即使只获得非方向性反馈,也能利用属性信息改善搜索;但方向性反馈提供了更明确的坐标变化方向。合成反馈虽弱于环境直接反馈,却稳定优于无反馈。
- 诗歌环境要求每行满足7、8、9或10音节。OptAgent通过逐行增加或减少音节的反馈迭代提示,10轮内可靠提升成功率;其表现优于或更稳定于Reflexion基线。
研究意义
研究说明,LLM并非只能进行随机提示改写;只要反馈表达“应该向哪里改”,模型便能执行类似梯度搜索的策略。这为代码调试、智能体规划、提示词工程和人机交互提供统一视角,也解释了为什么只有分数的黑箱优化往往不稳定。
技术贡献
论文提出把自然语言反馈形式化为文本空间中的一阶信息,并将“提出更新”和“接受更新”分离。Feedback Synthesizer以“What should I change about x to cause a larger change in y?”生成方向线索,区别于APO的错误归因式反思;Prompt Selector则以期望奖励不下降为接受标准。
新颖性
新颖性不在于首次使用LLM改提示,而在于系统揭示反馈方向性是优化能力的关键变量。相较APO、OPRO和Reflexion,论文同时研究数学函数与受约束诗歌,并把外部方向反馈、合成反馈和无反馈置于同一实验框架。
局限性
- 实验规模较小:数学任务仅四个二维函数、每条件10次且10步,不能代表高维、噪声或强非凸现实问题。
- 诗歌反馈依赖可程序化的音节检查器;开放式质量、语义、风格和多目标偏好仍难以自动提供可靠方向。
未来方向
未来应扩展到高维连续变量、离散代码和长期智能体任务,研究不确定性、反馈成本与自适应步长;还需比较不同模型、温度和提示模板,并建立真实用户反馈基准。
AI 总览摘要
LLM正被用于生成提示、代码和计划,但把语言模型当作优化器仍常出现随机改写、反复试错和奖励波动。传统优化的关键区别是是否拥有搜索方向:梯度告诉算法参数应向哪里移动,而自然语言系统通常只有分数或模糊评论。Nie等人由此提出一个核心问题:方向性反馈是否决定了LLM能否稳定优化?
论文提出Sequential Prompt Optimization,并实现OptAgent。系统保存每轮的输出、奖励、反馈和提示;Prompt Proposal根据历史提出新提示,Feedback Synthesizer可把数值奖励转成“应如何改变输入”的自然语言方向,Prompt Selector再比较新旧提示的期望奖励,只接受不下降的更新。这一结构把类似梯度的信息获取、文本改写和候选选择明确分开。
在Booth、McCormick、Rosenbrock和Six-Hump Camel四个函数上,GPT-3.5与GPT-4最多运行10步、重复10次;方向性反馈显著降低累计及最终遗憾,效果接近SGD,且帮助较弱模型。合成反馈虽不如真实方向反馈,仍优于无反馈。诗歌实验要求每行满足7至10音节,OptAgent通过增加或减少音节逐轮优化提示,表现优于或更稳定于Reflexion。研究的主要启示是:LLM优化的瓶颈不仅是模型能力,更是反馈是否包含可执行方向;但结论仍受小规模基准、短时域和程序化评价器限制。
深度分析
研究背景
APO和OPRO主要优化让另一LLM表现更好的提示;Reflexion等方法利用自我批评或历史经验。经典优化则区分无方向的黑箱搜索与有梯度的高效更新。论文将这一差异迁移到文本空间,考察自然语言反馈是否能充当一阶信息。
核心问题
目标是寻找ptunable,使LLM代理π在任务ptask下的期望奖励最大:p* = arg max E[r|π(ptask,p)].文本没有固定的代数差分,模型既要判断改动方向,也要决定改多少;仅有标量奖励时,历史轨迹能否替代梯度仍不明确。
核心创新
第一,定义方向性反馈、非方向性反馈和仅奖励反馈。第二,提出Sequential Prompt Optimization,把反馈合成、提示提议和候选选择模块化。第三,用环境方向反馈及LLM生成的Synthetic Feedback验证同一原则。第四,将受控数值优化与诗歌提示优化连接起来,展示跨任务可迁移性。
方法详解
- �� Agent输入ptask与ptunable,生成o并获得r、f;Agent不自行查看历史。
- �� Prompt Proposal模块Δ读取任务、历史提示、奖励和反馈,输出新提示,可完全重写文本。
- �� Feedback Synthesizer ˆF在只有(o,r)时生成改变方向,强调输入变化对输出变化的影响。
- �� Prompt Selector比较新旧提示的期望奖励,仅在新提示不差时替换。
- �� 数学实验令奖励R(x)=-J(x),方向反馈为∇R(x);诗歌反馈逐行报告音节数及增减方向。
实验设计
数值基准包含Booth、McCormick、Rosenbrock和Six-Hump Camel,变量为二维x,比较GPT-3.5、GPT-4、SGD、无反馈、非方向性反馈和方向性反馈。每条件10次、最多10步,指标为Simple Regret |J(xT)-J(x*)|与Cumulative Regret。诗歌任务要求每行7、8、9或10音节,使用完整Algorithm 1,并与Reflexion比较。
结果分析
图2显示GPT-4无反馈时也能从历史中粗略推断方向,但GPT-3.5常失败;加入方向反馈后两者均改善。图3表明方向反馈下最终遗憾接近SGD;GPT-4最终点未必更近,可能因模型自定步长且仅运行10步。图4显示Synthetic Feedback不及真实方向反馈,却稳定超过无反馈。图5显示OptAgent在四类音节任务中逐轮提高奖励。
应用场景
可用于自动提示词工程、代码调试、API参数调整、规划策略和受约束内容生成。前提是环境能返回奖励,最好还能指出变量或属性应增减;若只有分数,可调用Feedback Synthesizer生成近似方向。
局限与展望
论文没有给出跨模型大规模统计或统一的数值提升百分比;实验任务短、维度低,且接受标准依赖额外评估调用。方向性反馈在开放式写作中难以自动获得,LLM还需自行选择步长,可能过度修改或陷入局部区域。未来应研究高维离散空间、噪声反馈、多目标奖励和真实人类评价。
通俗解读 非专业人士也能看懂
把LLM想成一家试做新菜的厨房。厨师每次按一张配方做菜,顾客给分数;如果只说“6分”,厨师知道结果一般,却不知道该加盐、减糖还是改变火候,这就是只有奖励的情况。如果顾客说“太咸,请少放盐”,这就是方向性反馈:没有规定精确克数,却明确告诉厨师往哪个方向改。
OptAgent像总厨。它保存每次配方、成品、分数和顾客意见,再写出下一张配方。新菜做好后,它还会和旧菜比较;如果没有更好,就不换配方。这样,系统不是每次随机重来,而是从过去经验中连续调整。
数学函数实验相当于在山谷里找最低点:方向反馈像有人指着“往东南走”,没有反馈则只能盲走。诗歌实验则像要求每行恰好有指定音节数;系统收到“这一行应多两个音节”后,逐轮修改写作说明。论文因此说明,聪明的试错不只需要结果,还需要知道改变方向。
简单解释 像给14岁少年讲一样
想象你在游戏里调一个角色的装备,目标是让得分更高。每次换装备后,系统可能只告诉你“得分42”,也可能说“速度太慢,把敏捷提高一点”。第二种提示明显更有用,因为它告诉你往哪边改,虽然没有告诉你必须加多少。
这篇论文研究的就是这种差别。研究者让GPT-3.5和GPT-4解决数学函数,也让它们改写提示词来写符合音节要求的诗。每轮模型根据过去的尝试提出新方案,再检查新方案是否真的更好;变差了就保留旧方案。
结果很直观:给出“增加还是减少”的方向后,两个模型都更会搜索,最后效果接近简单的梯度下降。只有分数时,GPT-4还能从历史中猜一点规律,但GPT-3.5更容易乱跑。没有直接方向时,让另一个模块总结“输入该怎么改变”也有帮助。
所以,LLM优化像改游戏策略:只说输赢不够,告诉它哪一步该向哪边走,通常更稳定。不过数学函数和音节检查都比较简单,真实世界的“好不好”常常主观得多,未来仍需更难、更真实的测试。
术语表
Directional Feedback(方向性反馈)
指出输入应朝哪个方向改变,但不必给出精确改变量,类似自然语言中的梯度信息。
数学实验使用∇R(x),诗歌实验报告每行应增加或减少音节。
Non-directional Feedback(非方向性反馈)
指出重要属性或存在问题,却不说明应增大还是减小。
实验只告诉模型哪些坐标或诗歌行违反约束。
Sequential Prompt Optimization(序列提示优化)
逐轮收集输出、奖励、反馈和提示,并提出、评估、选择新提示的框架。
论文的主要算法框架,即Algorithm 1。
Feedback Synthesizer(反馈合成器)
根据历史输入和奖励生成自然语言改动建议。
在环境只提供数值奖励时近似补足方向信息。
Simple/Cumulative Regret(最终/累计遗憾)
前者衡量最终解距最优解的差距,后者累加每一步差距,分别反映准确性与效率。
用于四个数学函数上的比较。
开放问题 这项研究留下的未解疑问
- 1 高维、离散和强噪声文本空间中,方向反馈是否仍能保证稳定改进?论文只测试二维函数和短程提示更新。
- 2 真实用户意见往往含糊、矛盾且昂贵;如何校准合成反馈的可信度,并处理多目标偏好,仍缺乏理论和基准。
应用场景
近期应用
自动提示词工程
团队可记录提示、模型输出和评分,再让Feedback Synthesizer生成“应增加、删除或重写什么”的建议;Prompt Selector用离线评测保留改进版本,适合分类、摘要和受约束生成。
代码与参数调试
执行器返回测试失败、错误位置和性能分数,优化器把这些信息转成具体修改方向,例如减少超时、增加边界检查或调整API参数,再用回归测试筛选候选。
远期愿景
可解释的自主智能体
未来智能体可把用户反馈、环境信号和历史轨迹统一为可审计的方向信息,在规划、机器人控制和长期任务中逐步改进,同时保留旧策略作为安全回退。
原文摘要
We study the potential of using large language models (LLMs) as an interactive optimizer for solving maximization problems in a text space using natural language and numerical feedback. Inspired by the classical optimization literature, we classify the natural language feedback into directional and non-directional, where the former is a generalization of the first-order feedback to the natural language space. We find that LLMs are especially capable of optimization when they are provided with {directional feedback}. Based on this insight, we design a new LLM-based optimizer that synthesizes directional feedback from the historical optimization trace to achieve reliable improvement over iterations. Empirically, we show our LLM-based optimizer is more stable and efficient in solving optimization problems, from maximizing mathematical functions to optimizing prompts for writing poems, compared with existing techniques.