FinEvolveBench: A Benchmark for Self-Evolving Agents on Low-Repetition Tasks with Implicit Rewards

TL;DR

FinEvolveBench以31个A股行业、177324篇新闻检验延迟反馈下的智能体自进化,通用记忆未稳定提升IC。

cs.CL 🔴 高级 2026-06-05 16 次浏览
Zihao Deng Yining Zhu Leiming Wang Jingfei Lu Junbo Wang Chuncheng Ran Yu Yang Dixuan Yang Jikun Shen
智能体自进化 金融NLP 外部记忆 延迟奖励 基准评测

核心发现

方法论

FinEvolveBench按时间重放金融信息流:覆盖31个申万一级行业指数和177324篇中国财经新闻。智能体读取预测日前4日至当日新闻,输出10、20、40个交易日的连续市场情绪分数s∈[-1,1]。反馈采用相对中证1000收益α=r行业-rCSI1000,并在结果成熟后才更新经验。比较Pipe、Pipe+mem0和基于MemRL的效用更新系统。

关键结果

  • 在DeepSeek-V4-Flash与Qwen3-35B-A3B上,Pipe的总体tsIC在全部六个已完成的模型—期限组合中最高。DeepSeek上Pipe为0.0243、0.0517、0.0595;Qwen上为0.0349、0.0676、0.0677,说明可用记忆并不等于预测增益。
  • Pipe+MemRL相对Pipe的差距依模型和期限而变:DeepSeek在10日和20日落后0.0068与0.0335,Qwen落后0.0163与0.0195;40日Qwen的MemRL仅为0.0135,而Pipe为0.0677。
  • Frozen MemRL消融显示效用更新具有条件性:Qwen在10/20日的总体tsIC分别提升0.0382/0.0731,csIC提升0.0392/0.0834,但40日下降;DeepSeek总体tsIC三种期限均下降,说明延迟反馈可能校准,也可能污染检索。

研究意义

论文把自进化评测从重复、可验证的任务推进到低重复、非平稳且反馈隐含的真实决策环境。它提醒研究者:记忆系统若只存储轨迹,面对噪声市场结果和长期信用分配,未必能泛化。对工业界而言,金融预测、风险监控和信息筛选不能仅凭离线准确率判断自适应能力,还必须检验反馈到达顺序、阶段变化与跨模型稳定性。

技术贡献

核心贡献是一个因果重放接口,而非新的语言模型训练算法。每个预测在生成后冻结,未来新闻、价格和未成熟结果均不可见;不同期限的反馈独立成熟。数据侧保留完整新闻标题与正文,不去重、不按重要性过滤,并以市场调整收益构造连续标签。评测同时报告时间序列IC与横截面IC,并用Frozen MemRL匹配消融隔离效用更新影响。

新颖性

相较SWE-bench、GAIA、ALFWorld等具有明确成功信号的基准,FinEvolveBench专门测试低重复任务中的隐式、延迟、结果级反馈。相较FinQA、FinBen等静态金融数据集,它重建连续信息流并允许研究者自定义期限;相较StockBench,它发布177324篇完整新闻而非检索少量文章,重点从交易盈利转向经验驱动的预测适应。

局限性

  • 实验只使用DeepSeek-V4-Flash和Qwen3-35B-A3B,且时间窗口为2025年1月2日至2026年3月31日;结论可能受模型、市场制度和阶段分布限制。
  • 市场调整收益同时受公开信息、未观测因素与制度变化影响,无法把结果归因到某篇新闻或某一步推理;因此效用更新的信用分配仍不确定。
  • Mem0与MemRL在表示和检索策略上并不匹配,只有Frozen MemRL提供较严格的更新消融。

未来方向

未来应发展跨案例抽象而非简单轨迹检索的记忆机制,引入市场状态条件化、冲突证据与反馈不确定性表示,并学习何时拒绝复用经验。还需扩展更多模型、市场和预测期限,报告滚动阶段、成本、风险与统计显著性。

AI 总览摘要

语言模型智能体能否在部署后从经验中变强,是当前自主系统研究的核心问题。既有基准多围绕软件修复、网页操作或工具调用,任务模式重复,成功信号即时且清晰;真实决策却常常相反:相似新闻可能引发不同市场反应,结果要数周后才出现,且无法明确归因。

FinEvolveBench重建了中国A股信息流,包含31个申万一级行业、177324篇来自九家财经媒体的新闻,以及每日市场记录。系统在300个交易日上进行因果重放,读取日前4日至当日信息,输出10、20、40交易日后的行业方向分数。反馈定义为行业收益减中证1000收益,并仅在期限成熟后进入外部经验。实验比较无经验Pipe、追加轨迹的mem0和具有反馈效用更新的MemRL。

结果具有诊断性而非简单排行榜意义。Pipe在DeepSeek与Qwen的六个模型—期限组合中均取得最高总体tsIC,例如Qwen的10/20/40日分别为0.0349、0.0676、0.0677。匹配消融显示,效用更新在Qwen短期限提升tsIC 0.0382和0.0731,却在40日下降;DeepSeek则多数设置受损。论文因此表明,经验可用性、反馈更新和真正的自进化并非同义词;未来系统需要理解情境、 regime变化与不确定性。

深度分析

研究背景

Reflexion、Mem0、Evo-Memory和MemRL推动了运行时记忆;SWE-bench、GAIA、LifelongAgentBench和ALFWorld则评估任务完成。但这些环境通常有明确标签或可重复技能。FinQA、TAT-QA、FinBen是静态金融理解数据集,StockBench虽有时间性却偏重交易盈利。FinEvolveBench针对更接近现实的低重复预测。

核心问题

智能体需从时间有序新闻预测未来行业相对表现,却只能获得延迟、连续且带噪的结果信号。相似主题不保证相同反应,旧经验可能在新市场状态下失效。核心难点是因果访问控制、跨期限信用分配、非平稳分布和何时复用经验。

核心创新

  • �� 构建177324篇完整新闻的连续流,而非静态样本。
  • �� 用因果重放交错新预测与旧结果,严格隐藏未来信息。
  • �� 以α=r行业-rCSI1000建立隐式市场反馈。
  • �� 同时报告tsIC与csIC,并按Cold-Start和Exploitation分阶段。
  • �� 以Frozen MemRL控制表示、检索和提示,只改变效用更新。

方法详解

  • �� 输入:日期t前4日至t的行业过滤新闻、当日收盘价和合法经验。
  • �� 输出:每个行业i及期限h的分数s_i,t,h∈[-1,1],表示未来方向而非词汇情感。
  • �� 标签:r_i,t,h=close_i,t+h/close_i,t-1;α_i,t,h=r_i,t,h-r_CSI1000,t,h。
  • �� 系统:Pipe不存经验;mem0追加完整轨迹;MemRL按10/20/40日维护独立效用。
  • �� 评估:时间序列IC衡量行业自身随时间的跟踪,横截面IC衡量同日行业排序;三次独立运行取平均。

实验设计

数据含2024-01-01至2026-05-03新闻、截至2026-06-30市场标签、696个活跃新闻日和平均254.78篇/日。预测期为300个交易日;前1/3为Cold-Start,后2/3为Exploitation。骨干模型是32,768上下文的DeepSeek-V4-Flash和Qwen3-35B-A3B。比较Pipe、mem0、MemRL,并进行Frozen MemRL消融。

结果分析

Pipe在全部总体tsIC组合领先。DeepSeek Pipe为0.0243/0.0517/0.0595,Qwen为0.0349/0.0676/0.0677。DeepSeek的MemRL为0.0175/0.0182/0.0269,Qwen为0.0186/0.0481/0.0135。Qwen效用更新短期有效,DeepSeek多数条件无效或有害,显示结果依赖骨干、期限、阶段和指标。

应用场景

可用于金融新闻监测、行业轮动研究、风险预警和信息流排序,但不应直接等同于可交易策略。部署前需要时间切分、延迟标签、市场基准调整和严格防泄漏;评估应同时考察排序能力、阶段稳定性和反馈更新成本。

局限与展望

数据集中于中国A股和两个模型,不能保证跨市场或跨模型复现。α是结果级代理信号,无法解决新闻级信用分配;新闻还保留重复与噪声,可能影响模型上下文。未来应加入 regime识别、跨案例摘要、置信度建模、更多市场与统计检验,并报告计算和延迟成本。

通俗解读 非专业人士也能看懂

把智能体想成一位每天给31个行业写天气预报的分析员。它每天阅读最近几天的报纸,预测某行业未来10、20或40个交易日会相对大盘变好还是变差。预测写下后不能修改,也不能偷看未来报纸。几周后,真正的市场结果才回来,像考试成绩延迟公布。

研究者测试三种工作方式:第一种从不保存旧笔记;第二种把每天的完整笔记放进档案柜;第三种根据后来成绩给旧笔记打分,决定以后更容易翻看哪些笔记。问题在于,类似标题并不意味着市场会有类似反应,且成绩好坏可能由许多看不见的原因造成。

结果很有启发:保存更多笔记没有稳定变聪明。最简单的“不用经验”方法在所有六个模型—期限组合中取得最高总体时间序列IC。反馈打分在Qwen模型的10日和20日任务上有帮助,却在40日任务上变差;DeepSeek多数情况下也变差。就像学生不能只因为一次考试考好,就认定整套旧笔记永远适用。

简单解释 像给14岁少年讲一样

想象你在玩一个预测游戏:每天看新闻,猜未来某个行业会涨还是跌。答案不会马上揭晓,而是10天、20天或40个交易日后才知道。更麻烦的是,输赢不一定是某一条新闻造成的,可能还有政策、国际事件和大家没看到的消息。

这篇论文做了一个大型训练场FinEvolveBench。里面有31个中国股票行业、177324篇财经新闻和300个预测日。机器人每天只能看当时已经出现的新闻,不能作弊偷看未来。它可以不记笔记,也可以保存以前的预测,还可以根据后来结果给旧笔记加分。

结果不是“记忆越多越厉害”。DeepSeek和Qwen上,最简单的不保存经验方法在全部六种期限组合中都拿到最高总体tsIC。Qwen的反馈记忆在短期任务有时变好,但长期40日反而下降;DeepSeek也多数受损。

这像游戏里的攻略:某一关好用的技巧,换地图后可能完全失效。真正聪明的机器人不只是收藏攻略,还要判断当前是不是相同环境、旧经验有多可靠,以及什么时候应该说“这次我不确定”。

术语表

Information Coefficient(信息系数,IC)

衡量预测分数与真实结果相关程度的指标。tsIC看单一行业随时间的关系,csIC看同一天不同行业的排序关系。

论文用两者分别评价预测跟踪能力和横截面排序能力。

Implicit Reward(隐式奖励)

不是即时给出的正确或错误标签,而是之后由环境结果间接产生的反馈。它通常连续、 noisy且难以归因。

行业相对收益α就是智能体的延迟结果信号。

Causal Replay(因果重放)

按真实时间顺序重建交互,只允许系统使用当时已经可获得的信息。未来数据和未成熟结果被严格隐藏。

FinEvolveBench用它防止金融预测中的时间泄漏。

MemRL

一种把轨迹写入外部记忆并根据反馈更新检索效用的机制。论文为10、20、40日分别维护效用。

Pipe+MemRL与Frozen MemRL用于检验效用更新效果。

Low-Repetition Task(低重复任务)

实体或主题可能再次出现,但证据到结果的映射不稳定,因此旧案例不能直接复用。

新闻主题相似但市场反应不同,构成基准的核心难点。

开放问题 这项研究留下的未解疑问

  • 1 如何把多条历史轨迹抽象成适用于当前市场状态的规则,而不是机械检索相似案例?现有结果尚不能区分语义相似、因果相似和真正可复用经验。
  • 2 延迟市场收益如何分配给新闻、推理步骤和记忆条目仍未解决。需要不确定性建模、反事实测试和跨市场复现。
  • 3 效用更新为何在Qwen短期有效、在DeepSeek多数设置有害?更大规模模型、不同提示和更长时间序列可能揭示交互机制。

应用场景

近期应用

金融信息流评估

研究团队可用九家媒体新闻和31个行业构建严格时间回放,比较新记忆机制是否真正改善10至40日预测,而不是只报告静态分类准确率。

风险监测原型

金融机构可将行业情绪分数用于研究员预警和新闻筛选,但必须保留未来不可见约束,并将α作为研究信号而非直接交易指令。

远期愿景

情境化自进化分析师

未来系统可识别市场状态、整合冲突证据并主动降低不可靠记忆权重,从而支持跨周期的研究辅助与风险决策。

原文摘要

Experience-based self-evolution enables language-model agents to improve their behavior by accumulating and updating experience at test time, yet existing evaluations often assume recurring task patterns and explicit success signals. We introduce \textsc{FinEvolveBench}, a benchmark for self-evolving agents on low-repetition tasks with implicit rewards. The benchmark reconstructs a daily financial information stream over 31 Chinese A-share industry indices and aligns 177,324 public news articles with market observations. Researchers can define prediction horizons over this stream; we evaluate predictive market-sentiment factors against delayed market-adjusted returns after 10, 20, and 40 trading days. Unlike static benchmarks that score each prediction independently, \textsc{FinEvolveBench} interleaves new decisions with delayed outcomes from earlier ones, testing whether agents can convert noisy real-world feedback into reusable experience at test time. Experiments with two backbone models show that the evaluated general-purpose memory systems do not consistently outperform the no-experience pipeline. A matched ablation further shows that feedback-driven utility updates help at shorter horizons on one backbone but hurt in most settings on the other. Together, these results position \textsc{FinEvolveBench} as a diagnostic testbed for experience-based self-evolution under noisy, delayed, and outcome-level feedback.

cs.CL