核心发现
方法论
采用结构化八维行为模型,从Polymarket交易数据中提取钱包行为参数,评估其时间稳定性和识别性。通过提示注入策略,将提取的行为特征注入LLM,但未能显著提升模型输出多样性或降低误差相关性。评估指标包括ICC、Top-1检索率、Jensen-Shannon散度和Brier分数。
关键结果
- 从100个钱包中,8个参数表现出时间稳定性(ICC≥0.5,bootstrap下界>0.3),contrarian分数ICC达0.9,钱包可被识别(Top-1 17-22%远高于1%的随机基线);两维参数与未来盈利存在相关性(未控行为混杂因素)
- 提示注入未能显著增强模型输出多样性,结构化注入在语义嵌入指标上无优势,未降低误差相关性,也未改善Brier分数,表现为空效应。
- 分析提示结构未随输入参数扩散,提示结构趋于一致,限制了认知多样性的注入效果。
研究意义
本研究揭示了认知单一化在预测市场和集体决策中的潜在风险,强调仅通过提示层面注入难以实现认知多样性,推动向模型内部调优(如微调、激活调控)方向发展。这对于理解大模型在集体智能中的局限具有重要意义,为未来构建多样化智能系统提供理论基础。
技术贡献
提出结构化八维行为模型,结合行为数据进行特征提取,验证其在认知多样性中的潜力。设计了基于提示的注入机制,系统评估其在模型输出中的传递效果,明确指出提示层面限制。为认知多样性注入提供了量化指标和实证分析,推动多模态、多层次模型调控研究。
新颖性
首次系统性从真实交易行为中提取认知行为参数,并尝试通过提示注入实现认知多样性,验证其在集体预测中的作用。区别于以往手工设计角色或架构多样性的方法,强调数据驱动的行为模型和注入机制的结合,揭示了提示层面认知注入的局限性。
局限性
- 提取参数虽表现出一定的稳定性,但未能完全反映深层认知结构,存在行为-认知映射偏差。
- 提示注入未能有效传递认知特征,受限于提示结构的表达能力和模型对persona的理解。
- 实验未能在大规模多样性场景中验证认知多样性对集体预测的实际改善,未来需结合模型微调等手段。
未来方向
未来将探索模型内部调优(如参数微调、激活调控)以实现更深层次的认知多样性注入,结合多模态行为数据丰富行为模型,提升认知特征的表达和传递效果。同时,扩展到多任务、多场景下验证认知多样性的实际效用。
AI 总览摘要
在集体决策和预测市场中,认知多样性被视为提升系统鲁棒性和准确性的关键因素。然而,现有大模型(LLM)由于训练数据和架构的限制,表现出高度的认知同质性,导致错误高度相关,限制了集体智能的潜能。本文提出了Nous框架,试图从真实交易行为中提取八维认知行为参数,并通过提示注入机制将其引入模型,旨在增强模型的认知多样性。
研究首先验证了行为参数的可提取性:在Polymarket的100个钱包中,8个参数表现出时间稳定性(ICC≥0.5),钱包可被识别(Top-1 17-22%),部分参数与未来盈利相关。这表明行为模型具有一定的代表性和可用性。随后,作者设计了结构化的提示注入策略,将提取的行为特征注入模型,试图激发不同的认知路径。
然而,实验结果显示,提示层面的结构化注入未能显著提高输出多样性或降低误差相关性。通过语义嵌入指标,结构化注入与控制提示无显著差异,输出的认知多样性未能有效传递。这揭示了提示层面认知注入的局限性,提示结构未能随输入参数扩散,限制了认知特征的表达。
整体而言,本文强调了认知单一化在集体预测中的风险,指出仅靠提示层面难以实现深层次的认知多样性。未来,需结合模型微调、激活调控等技术,深入探索认知多样性的实现路径。此研究为理解大模型在集体智能中的局限提供了理论基础,也为未来多样性增强策略提供了重要启示。
深度分析
研究背景
近年来,预测市场和集体决策中,模型的预测能力不断提升,代表性工作包括Halawi等的结构化推理框架和Mantic系统的强化学习优化。这些方法在单一模型性能上取得突破,但在多模型或多智能体系统中,认知多样性不足,导致错误相关性高,限制集体智慧的效果。行为经济学和认知科学提供了丰富的理论基础,强调个体认知差异的重要性,然而,如何将这些差异有效融入大模型仍是未解难题。
核心问题
核心问题在于大模型普遍存在认知单一化,导致多模型集成时错误高度相关,削弱集体预测优势。传统方法依赖架构差异难以规模化,且提示层面调控效果有限。如何从真实行为中提取认知特征,并有效注入模型,成为提升集体智能的关键瓶颈。
核心创新
提出结构化八维行为模型,从交易行为中提取认知参数,验证其稳定性和识别性。设计提示注入策略,将行为特征引入模型,尝试激发认知多样性。创新点在于:1)数据驱动的行为参数提取;2)基于提示的认知注入机制;3)系统评估认知多样性在集体预测中的效果。这为模型调控提供了新思路。
方法详解
- �� 采集Polymarket交易数据,定义8维行为参数。• 计算参数的时间稳定性(ICC)和识别性(Top-1检索)。• 设计结构化提示,将参数注入模型。• 通过语义嵌入和误差相关性指标评估注入效果。• 进行多轮控制实验,调整提示长度和内容,验证传递效率。• 分析参数扩散性与输出多样性关系,识别瓶颈。
实验设计
使用Polymarket的交易数据,提取钱包行为特征,验证参数的稳定性和识别性。设计结构化提示,将行为特征注入不同LLM模型,评估输出多样性和误差相关性。采用Jensen-Shannon散度、Brier分数等指标,进行多场景、多参数的对比分析。通过控制变量,验证提示结构对认知特征传递的影响。
原文摘要
As LLM agents proliferate in prediction markets and collective decision-making, they risk a cognitive monoculture: agents built on shared foundation models produce correlated forecasts, and recent measurement finds frontier-model errors correlated at r ~ 0.77. We ask whether human cognitive diversity can be recovered from behavior and transferred to LLM agents. Nous extracts a structured eight-dimension behavioral profile from real Polymarket trading activity and injects it into agents through prompts. Our central finding is a dissociation between the two halves of that pipeline. Extraction works, partially: across 100 wallets, 8 of 14 parameters are temporally stable (split-half ICC >= 0.5, bootstrap CI lower bound > 0.3; contrarian score reaches ICC ~ 0.9); wallets are identifiable from their profiles well above chance (top-1 retrieval 17-22% vs. 1% chance); and two of four pre-specified dimensions rank-correlate with future realized profit out-of-sample, though the correlations do not survive behavioral-confound controls. Prompt-level injection does not measurably transmit it: on a semantic embedding metric, structured injection shows no significant advantage over a length-matched control on any model, and the diversity it induces neither reduces ensemble error correlation nor improves Brier score -- a null that persists across exploratory checks on sampling temperature, profile diversity, and question difficulty. Measuring the prompts themselves locates the compression before the model: the structure-to-narrative translator emits near-uniform prompts whose spread does not track profile spread. We position Nous as measuring the cognitive-monoculture problem and the limits of a prompt-level remedy, motivating deeper, below-the-prompt injection (fine-tuning, activation steering). Code, frozen profiles, prompts, and model outputs: https://github.com/WillChienT/nous-paper