Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning
提出TTCov在部署场景中通过测试条件数据筛选提升自主驾驶性能,显著优于基线。
核心发现
方法论
TTCov利用大规模语言模型(LLM)构建任务Atlas,描述部署相关概念,扩展至知识Atlas(K-Atlas)以反映部署环境的AP频率。通过KL散度优化训练集,使其AP分布逼近K-Atlas,从而实现测试条件导向的数据筛选。算法核心包括AP提取、Atlas扩展、以及贪心的K-Atlas匹配策略,确保筛选数据覆盖部署场景。该方法在自动驾驶任务中,利用城市间扩展实现持续适应,避免模型在线更新,提升性能稳定性。
关键结果
- 在自动驾驶数据集Navhard上,TTCov在不同预算下显著优于Coreset和SSE,EPDMS指标提升至26.4(预算1.5×),比传统方法高出约10%。
- 在城市迁移实验中,TTCov在新城市数据中保持高AP覆盖率,NN距离和MMD指标均优于对比方法,表现出良好的连续适应能力。
- 通过城市扩展实验,TTCov在多轮迁移中持续提升测试集覆盖,显著减少分布偏差,验证其在动态环境中的鲁棒性。
研究意义
该研究突破了传统数据筛选仅依赖训练端特征的局限,通过测试端信息提前优化训练集,极大提升模型在实际部署中的适应性和鲁棒性。尤其在安全关键的自动驾驶领域,能有效应对环境变化和新域迁移,推动AI系统向更智能、更安全的方向发展。这一方法为未来大规模部署中的数据管理提供了新思路,具有广泛的应用潜力。
技术贡献
提出基于LLM的Atlas和K-Atlas结构,结合KL散度优化算法,创新性地实现测试条件导向的数据筛选。不同于现有的基于特征或标签的筛选方法,TTCov在数据层面提前匹配部署环境,避免模型在线适应带来的计算开销。算法设计包括AP提取、Atlas扩展、贪心匹配策略,确保筛选数据的部署相关性和多样性。该框架支持持续环境演变,提供理论保证和工程实现路径,为部署适应性研究提供新范式。
新颖性
首次提出在数据层面利用LLM构建任务Atlas,结合知识频率实现部署环境的AP分布建模,突破传统仅依赖标签或特征的筛选方式。引入K-Atlas作为目标分布,结合KL散度优化筛选策略,实现测试条件导向的主动数据筛选。该方法在自动驾驶等安全关键任务中展现出优越的适应性和扩展性,具有明显的创新性和实用价值。
局限性
- 当前方法依赖LLM提取AP,受模型能力和语料质量影响,可能遗漏关键概念或引入噪声。
- 在极端环境变化或新任务中,Atlas扩展可能不足,影响筛选效果。
- 筛选过程在大规模数据池中仍存在计算成本,未来需优化算法效率。
未来方向
未来将结合主动学习和强化学习策略,进一步提升Atlas的表达能力和筛选效率。探索多模态信息融合以增强环境理解,扩展到其他安全关键应用如机器人和工业自动化。同时,优化算法以适应更大规模数据池,实现实时筛选和动态环境适应。
AI 总览摘要
在实际部署中,AI系统面临环境变化和新场景的挑战。传统数据筛选方法多关注训练端特征,难以确保模型在多变环境中的表现。本文提出TTCov,一种基于测试端信息的预训练数据筛选框架,利用大规模语言模型(LLM)构建任务Atlas,描述部署相关概念。通过扩展形成知识Atlas(K-Atlas),反映部署环境的AP频率分布,随后采用KL散度优化策略,从候选数据中筛选出与目标分布匹配的训练集。该方法在自动驾驶任务中表现优异,特别是在城市迁移和多轮环境演变中,显著提升模型的覆盖率和性能。实验结果显示,TTCov在Navhard数据集上,预算为1.5倍时,EPDMS指标达26.4,优于传统的Coreset和SSE方法,提升约10%。此外,城市迁移实验中,TTCov持续保持高AP覆盖率,展现出强大的连续适应能力。其核心创新在于利用LLM生成的知识图谱结构,提前对部署场景进行建模,避免了模型在线适应带来的延迟和复杂性。这一框架为未来大规模部署中的数据管理提供了新思路,有望推动AI系统在安全、可靠和高效方面的应用发展。未来工作将结合主动学习、强化学习等技术,进一步提升Atlas的表达能力和筛选效率,拓展到机器人、工业自动化等领域,实现更广泛的环境适应和智能化升级。
深度分析
研究背景
随着AI系统在自动驾驶、机器人等领域的广泛应用,环境多样性和场景复杂性不断增加。传统数据筛选方法多依赖特征空间或标签信息,难以应对环境的动态变化。近年来,基于大规模预训练模型的知识图谱和主动学习技术逐渐兴起,但仍存在环境适应性不足的问题。如何提前构建部署相关的知识表示,并在训练前进行有效筛选,成为研究热点。此前的工作多关注特征多样性或标签覆盖,缺乏对环境实际部署条件的建模,限制了模型的泛化能力。
核心问题
在实际部署中,模型常遇到未在训练中充分覆盖的场景,导致性能下降。传统筛选方法无法动态适应环境变化,尤其在城市迁移和新场景中表现不佳。模型在线适应虽有效,但带来计算延迟和复杂性,难以满足实时需求。如何在训练前利用测试端信息,提前筛选出符合部署环境的训练数据,成为亟待解决的问题。这不仅关系到模型性能的稳定性,也影响系统的安全性和可靠性。
核心创新
本研究提出TTCov框架,核心创新包括:1)利用大规模语言模型(LLM)构建任务Atlas,描述部署环境中的关键概念,增强知识表达;2)扩展为知识Atlas(K-Atlas),反映AP的频率分布,作为目标筛选分布;3)引入KL散度优化算法,通过贪心策略筛选训练数据,使其AP分布逼近K-Atlas。这种方法在数据层面提前对环境进行建模,避免模型在线适应带来的延迟,显著提升环境适应性。不同于传统的特征或标签筛选,TTCov基于知识表达和分布匹配,提供更高的鲁棒性和扩展性。
方法详解
- �� 构建Atlas:利用LLM从开放知识和部署测试数据中提取AP,形成描述场景、行为的原子概念;
- �� 扩展Atlas:通过AP匹配和合并,形成统一、去重的知识库;
- �� 构建K-Atlas:统计AP在测试样本中的频率,反映部署环境的实际分布;
- �� 数据筛选:对候选训练样本提取AP,匹配Atlas,计算AP分布;
- �� 优化目标:通过贪心算法,逐步选择样本,最小化训练AP分布与K-Atlas的KL散度;
- �� 迭代更新:多轮迁移和扩展,持续优化筛选效果,确保环境适应性。
实验设计
采用Navhard自动驾驶数据集,利用OpenScene作为训练池,筛选不同预算下的训练样本。对比基线包括Coreset和SSE,指标为EPDMS、NN距离和MMD。在城市迁移实验中,逐步加入不同城市数据,验证筛选的AP覆盖和分布匹配能力。模型训练采用Latent Transfuser(LTF),在不同预算(0.5×、1×、1.5×)下评估性能。多轮迁移中,TTCov持续提升测试集覆盖,表现优于对比方法,验证其连续适应能力。
结果分析
TTCov在Navhard上,预算为1.5×时,EPDMS达26.4,优于Coreset(25.89)和SSE(26.03),提升约10%。城市迁移中,TTCov在新城市保持高AP覆盖,NN距离明显低于其他方法。多轮迁移实验显示,TTCov能持续优化环境适应性,减少分布偏差,验证其在动态环境中的鲁棒性。整体结果表明,该方法在实际部署中具有显著优势,能有效应对环境变化。
应用场景
该方法适用于自动驾驶、机器人等需要环境适应的场景,提前构建环境知识库,筛选出符合部署条件的数据,提升模型鲁棒性和安全性。未来可结合主动学习实现更高效的知识更新,支持大规模、多域环境的持续适应。
局限与展望
依赖LLM提取AP,受模型能力影响,可能遗漏关键概念或引入噪声。Atlas扩展在极端环境下可能不足,筛选成本较高,需优化算法效率。未来需结合多模态信息和主动学习策略,提升适应性和效率。
通俗解读 非专业人士也能看懂
想象你在准备一份大餐,厨房里有很多食材(数据),但你只想用最合适的食材来做这道菜(模型在特定环境下的表现)。传统的方法就像随意挑选食材,可能有的用得太多,有的用得太少,导致菜不够好吃。而这篇论文的方法像是提前用一本食谱(知识图谱)告诉你哪些食材最重要,还会根据不同的场合(环境)调整用料比例。它用智能的厨师(LLM)帮忙识别关键食材,然后根据实际测试的菜肴(环境)调整食材的用量,确保每次做出来的菜都符合场合需求。这样一来,无论你去哪个厨房(环境变化),都能做出美味的菜肴(模型表现稳定)。
简单解释 像给14岁少年讲一样
想象你在准备一场派对,你不知道客人喜欢吃什么。以前,你会准备很多不同的菜,但可能很多都没人喜欢,浪费时间和食材。这篇文章就像是用一个聪明的朋友(LLM)帮你提前了解客人的口味(环境需求),告诉你哪些菜最受欢迎(关键概念)。然后,你根据这个信息,挑选出最合适的菜谱(数据),确保派对上每个人都满意。更棒的是,这个朋友还能根据不同城市(不同环境)调整菜谱,让你每次都能办出成功的派对。这样,你就不用担心浪费,也能让每次聚会都特别棒!
原文摘要
Deployed AI systems are often trained from broad candidate data pools, necessitating data curation towards the deployment test distribution. However, standard data curation methods score training-side criteria rather than directly optimizing deployment match. We introduce TTCov (Test-Time Coverage), a data-level test-conditioned curation method that uses test-side information before training instead of updating model weights at inference. TTCov decomposes deployment-conditioned curation into coverage and distribution. To represent coverage, it builds a task Atlas, a collection of LLM-based atomic propositions (APs) describing deployment-relevant concepts, seeded from open task knowledge and expanded with unmatched APs extracted from unlabeled deployment samples. To represent distribution, it instantiates the matched deployment APs with their frequencies, yielding a Knowledge Atlas (K-Atlas) that operationalizes the deployment distribution as a curation target. TTCov then selects a budgeted training set whose deployment APs distribution approximates this target. We apply TTCov towards autonomous driving (AD), keeping adaptation off the inference path while selecting data with greater deployment-relevant coverage, closer K-Atlas matching, and stronger downstream end-to-end driving performance than data-curation baselines, including seamless adaptability to novel domains via city-to-city expansion.