Can Large Language Models Anticipate Behavioral Responses to Social Policies? A Case of Pension Enrollment Prediction among China's Flexible Workers

TL;DR

FlexPension-LLM模型预测中国灵活就业者养老金参与,F1值达0.9316。

cs.CL 🔴 高级 2026-09-04 99 次浏览
Yumiao Li Peixin Liu Donglin Di Chen Li Runhuan Feng
大语言模型 社会政策 养老金 灵活就业 中国

核心发现

方法论

本文提出FlexPension-LLM模型,结合DKI-RDistill框架,通过注入政策线索和错误过滤监督来预测灵活就业者的养老金参与。使用CHFS 2019数据集进行验证,模型通过LoRA/SFT进行微调,生成结构化的决策轨迹。

关键结果

  • FlexPension-LLM在CHFS 2019盲测中取得0.9316的Composite F1值,超过15个基线模型,并与Claude Opus 4.6无显著差异。
  • 在四个外部调查中平均Composite F1为0.7549,表现稳定。
  • 政策线索注入和错误过滤监督是性能提升的主要来源。

研究意义

该研究展示了大语言模型在社会政策评估中的潜力,特别是在预测灵活就业者的养老金参与上。通过减少试点项目的高成本和经济计量方法的不确定性,提供了一种新的政策模拟工具。

技术贡献

FlexPension-LLM结合了政策线索注入和错误过滤监督,显著提高了预测准确性。与现有模型相比,提供了更具解释性的决策轨迹,能够更好地模拟个体政策响应。

新颖性

这是首次将大语言模型应用于中国灵活就业者的养老金参与预测,创新性地结合了政策线索注入和错误过滤监督。

局限性

  • 模型在某些特定政策情境下可能表现不佳,特别是当政策规则复杂且变化时。
  • 对数据集的依赖可能限制模型在其他国家或地区的适用性。

未来方向

未来研究可以扩展到其他社会政策领域,进一步优化模型的政策线索注入机制,并探索跨国适用性。

AI 总览摘要

评估社会政策变化的影响一直是政策制定者面临的挑战。传统的经济计量方法在假设情境下不够可靠,而实地试点项目成本高昂。本文提出使用大语言模型(LLM)作为政策评估工具,特别是针对中国灵活就业者的养老金参与预测任务。FlexPension-LLM是首个专门针对这一任务的大语言模型,结合了DKI-RDistill框架,通过注入政策线索和错误过滤监督来提高预测准确性。

在CHFS 2019数据集的盲测中,FlexPension-LLM取得了0.9316的Composite F1值,超越了15个基线模型,并与Claude Opus 4.6无显著差异。模型在四个外部调查中表现出色,平均Composite F1为0.7549,显示出强大的跨调查泛化能力。政策线索注入和错误过滤监督是性能提升的关键因素。

该研究不仅展示了大语言模型在社会政策评估中的潜力,还为政策模拟提供了一种新的工具。未来的研究可以扩展到其他社会政策领域,进一步优化模型的政策线索注入机制,并探索跨国适用性。

深度分析

研究背景

社会政策评估是一个复杂的领域,传统的经济计量方法在预测政策变化的影响时常常不够准确。近年来,随着大数据和机器学习技术的发展,越来越多的研究开始探索使用这些技术来改进政策评估的准确性和效率。

核心问题

灵活就业者的养老金参与预测是一个具有挑战性的任务,因为其决策过程受到多种因素的影响,包括经济状况、家庭背景、历史参与情况和户籍政策等。

核心创新

FlexPension-LLM通过结合DKI-RDistill框架,创新性地将政策线索注入和错误过滤监督应用于养老金参与预测。这种方法不仅提高了预测准确性,还提供了更具解释性的决策轨迹。

方法详解

  • �� 使用CHFS 2019数据集进行训练和验证。
  • �� 通过DKI-RDistill框架注入政策线索。
  • �� 使用LoRA/SFT进行模型微调。
  • �� 生成结构化的决策轨迹。

实验设计

实验使用CHFS 2019数据集进行盲测,并在四个外部调查中进行验证。模型在盲测中取得了0.9316的Composite F1值,并在外部调查中表现稳定。

结果分析

FlexPension-LLM在盲测中超越了15个基线模型,并与Claude Opus 4.6无显著差异。在外部调查中,平均Composite F1为0.7549,显示出强大的跨调查泛化能力。

应用场景

该模型可用于预测灵活就业者的养老金参与,帮助政策制定者更好地理解政策变化的潜在影响,并进行更有效的政策模拟。

局限与展望

模型在特定政策情境下可能表现不佳,尤其是当政策规则复杂且变化时。此外,对数据集的依赖可能限制模型在其他国家或地区的适用性。

通俗解读 非专业人士也能看懂

想象一个复杂的拼图游戏,每个拼图块代表一个政策因素,如收入、家庭背景和户籍政策。FlexPension-LLM就像一个聪明的助手,能够快速识别每个拼图块的位置,并预测最终的拼图图案。这就像在一个大型超市中,FlexPension-LLM可以根据购物者的购物清单、预算和偏好,预测他们会购买哪些商品。

简单解释 像给14岁少年讲一样

想象你在玩一个策略游戏,你需要决定是否加入一个联盟。FlexPension-LLM就像游戏中的一个超级助手,它可以根据你的资源、朋友的建议和游戏规则,帮你做出最佳决策。就像在学校里,你需要决定参加哪个俱乐部,FlexPension-LLM会根据你的兴趣、时间和学校的规定,给你最好的建议。

术语表

大语言模型 (LLM)

一种能够理解和生成自然语言的人工智能模型,通常用于处理复杂的语言任务。

在本文中用于预测社会政策的影响。

DKI-RDistill

一种结合政策线索注入和错误过滤监督的框架,用于提高模型预测准确性。

用于FlexPension-LLM模型的训练。

Composite F1

一种衡量模型预测性能的指标,综合考虑了精确率和召回率。

用于评估FlexPension-LLM的预测性能。

LoRA/SFT

一种用于模型微调的技术,通过保持基础权重不变,仅训练低秩适配器参数。

用于FlexPension-LLM的微调。

政策线索注入

将政策相关信息作为输入线索注入模型,以提高预测准确性。

在DKI-RDistill框架中使用。

开放问题 这项研究留下的未解疑问

  • 1 如何在其他国家或地区应用类似模型?需要考虑哪些特定的政策和社会因素?
  • 2 模型在处理动态变化的政策规则时的表现如何?是否需要新的适应机制?

应用场景

近期应用

政策模拟

政策制定者可以使用该模型模拟不同政策变化对灵活就业者养老金参与的影响,以优化政策设计。

社会研究

研究人员可以利用该模型的数据分析能力,深入研究社会政策对不同人群的影响。

远期愿景

全球适用性

未来可以将该模型扩展到其他国家,帮助全球政策制定者进行更有效的政策评估。

原文摘要

Assessing the impacts of social policy changes is a widely acknowledged challenge for policymakers. Econometric methods can be unreliable when extrapolating to hypothetical scenarios, while field pilot programs are highly costly. In this paper, we propose using large language models (LLMs) as policy-assessment tools adapted from general-purpose models. We present FlexPension-LLM, the first domain-specialized large language model for a hierarchical pension-enrollment prediction task among flexible workers in China, and introduce DKI-RDistill, which injects policy-grounded cues into the prompt, including Probit-derived marginal effects and hukou-province pension rules. The method then uses LoRA/SFT to distill rationale-augmented supervision into an open-weight MoE student, with teacher errors corrected by regenerating those cases under ground-truth labels. On a CHFS 2019 blind split, FlexPension-LLM achieves 0.9316 Composite F1, surpassing its Claude Sonnet 4.5 teacher and 15 of 17 baselines, and is statistically indistinguishable from Claude Opus 4.6. Across four external surveys, it averages 0.7549 Composite F1 and shows the narrowest performance range among the strongest systems. Component analysis shows that gains come mainly from policy-grounded cue injection and error-filtered supervision, while rationales provide decision traces that can be checked against policy rules.

cs.CL