From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

TL;DR

EPIC通过偏好对齐索引构建技术,显著降低存储需求并提升个性化检索精度,节省4044倍内存。

cs.CL 🔴 高级 2026-05-18 44 次浏览
Changmin Lee Jaemin Kim Taesik Gong
机器学习 信息检索 个性化 边缘计算 知识图谱

核心发现

方法论

EPIC采用三阶段策略:首先利用语义空间中的距离关系进行粗筛,筛除偏好无关内容;其次通过语言模型进行细粒度验证,确保偏好一致性,并生成指令;最后通过偏好引导的查询调节,将用户查询向偏好方向偏移,提升匹配度。核心算法包括对比学习的Contriever编码器和基于Transformer的验证模型,结合FAISS索引实现高效检索。该流程在确保偏好对齐的同时,大幅度压缩存储空间,适应设备端有限内存。

关键结果

  • 在四个偏好评估基准中,EPIC将索引内存压缩了2404倍,偏好跟随准确率提升18.79个百分点,检索延迟降低32.17倍。实验在三平台(Jetson Nano、Mac M4、Galaxy Z Flip 6)上验证,内存控制在1MB以内,查询响应时间在5.21-29.35毫秒之间,支持流式偏好漂移更新。
  • 相较于传统的BM25、Contriever和NV-Embed,EPIC在偏好一致性和效率方面表现优越,显著改善个性化检索效果,尤其在偏好偏移场景中表现出更强鲁棒性。
  • 消融实验显示,粗筛阶段的语义距离过滤贡献最大,验证模型确保偏好精确匹配,偏好引导查询调节提升了偏好相关检索的召回率。

研究意义

该研究解决了在极端内存限制下实现个性化的核心难题,推动边缘设备上私有化智能助手的普及。通过偏好对齐的索引构建方式,不仅提升了检索效率,还增强了用户体验,满足隐私保护需求。该技术为未来个性化AI在移动端、物联网等场景的落地提供了技术基础,有望引领智能边缘设备的个性化发展新方向。

技术贡献

提出EPIC框架,创新性地结合语义空间筛选、语言模型验证和偏好引导机制,实现偏好对齐的紧凑索引。引入偏好相关指令生成,增强索引的表达能力。整体架构实现了在极低存储空间(<1MB)下的高效偏好个性化检索,突破了传统索引的存储和偏好对齐瓶颈。该方法兼具理论保证和工程实用性,为边缘端个性化AI提供新思路。

新颖性

首次提出将偏好信息作为索引构建的核心依据,采用多阶段筛选与验证机制,有效解决偏好偏移与存储限制问题。区别于以往偏好重写或存储全部数据的方案,EPIC强调偏好导向的选择性存储,提升效率与偏好一致性,具有明显创新性。

局限性

  • 依赖预先明确的偏好集合,难以应对动态偏好变化或隐式偏好推断,未来需结合偏好学习机制。
  • 在极端数据噪声或偏好模糊场景下,筛选和验证的准确性可能下降,影响整体性能。
  • 模型验证和指令生成依赖较大,硬件资源有限时可能存在一定的性能瓶颈。

未来方向

未来将探索偏好动态更新机制,结合在线学习和偏好推断,增强模型适应性。同时,优化指令生成的效率,扩展多模态偏好建模能力,推动个性化AI在更广泛场景中的应用落地。

AI 总览摘要

随着个人AI助手的普及,边缘设备上的个性化需求日益增长。然而,受限于硬件存储能力,如何在有限空间内高效存储偏好相关信息成为关键难题。传统索引方法往往存储大量无关数据,不仅浪费空间,还可能偏离用户偏好,影响响应质量。本文提出EPIC(Efficient Preference-aligned Index Construction)框架,通过多阶段筛选、验证和偏好引导,实现偏好对齐的紧凑索引。首先利用语义空间中的距离关系快速筛除偏好无关内容,确保高召回率;其次通过语言模型进行细粒度验证,确保偏好一致性,并生成指令增强索引表达;最后引入偏好引导的查询调节,将用户输入偏移至偏好方向,提高匹配精度。实验证明,EPIC在四个偏好评估基准中,将索引存储压缩了2404倍,偏好跟随准确率提升18.79个百分点,检索延迟降低32.17倍。在三平台上测试,EPIC保持在1MB以内的存储空间,响应时间在5.21-29.35毫秒之间,支持偏好漂移的实时更新。这一技术突破为边缘端个性化AI的实现提供了新途径,兼顾隐私保护与高效性能,推动智能设备的个性化发展迈向新台阶。

深度分析

研究背景

近年来,随着大型语言模型(LLMs)在自然语言处理中的突破,个性化AI助手成为研究热点。早期工作如RAG(Lewis et al., 2020)通过外部知识库增强生成能力,但多依赖静态数据集,难以满足动态偏好需求。后续研究如EMG-RAG(Wang et al., 2024)和PEARL(Mysore et al., 2024)尝试构建用户特定的记忆图谱或内容选择,但存储成本高,难以在设备端实现。传统索引方法如BM25和DPR(Karpukhin et al., 2020)在大规模数据中表现优异,但在设备有限存储下难以扩展。近年来,偏好条件化检索(如Pref-QR、PBR)逐渐兴起,强调在检索前融入用户偏好信息,但仍面临存储空间和偏好偏移的挑战。总体而言,现有方法多关注检索机制优化,缺乏高效偏好导向的索引构建策略,限制了个性化的广泛应用。

核心问题

在边缘设备上实现高效、偏好对齐的个性化检索,面临存储空间极度有限和偏好动态变化的双重难题。传统索引存储大量无关信息,浪费宝贵空间,且偏好偏移导致检索结果偏离用户期望。如何在保证偏好一致性的同时,极大压缩存储空间,成为核心瓶颈。此外,偏好信息的隐式表达和动态更新也增加了系统设计难度。解决这些问题不仅关系到个性化AI的实用性,也影响用户体验和隐私保护。

核心创新

EPIC提出多阶段偏好对齐索引策略:

  • �� 语义空间筛选:利用对比学习编码器快速筛除偏好无关内容,提升筛选效率。
  • �� 细粒度验证:借助语言模型严格验证偏好一致性,生成指令增强索引表达。
  • �� 查询调节:偏好引导的查询向量偏移,提升偏好匹配度。
  • �� 指令索引:将偏好指令与内容结合,形成紧凑、偏好导向的索引结构。

该架构在极低存储空间(<1MB)下实现偏好个性化,突破了传统索引的存储与偏好偏移瓶颈,兼具理论保证与工程实用性。

方法详解

  • �� 输入:设备端多源数据(静态知识、动态足迹、对话历史)和用户偏好集。
  • �� 粗筛:将数据和偏好编码到共享语义空间,计算余弦相似度,筛除偏好无关内容。
  • �� 细验证:用语言模型(如Transformer-based)对筛选后的内容进行偏好一致性验证,生成指令。
  • �� 指令存储:将指令与内容结合,索引偏好导向的指令-内容对,形成紧凑索引。
  • �� 查询调节:用户查询编码后,偏好向量偏移,提升偏好匹配。
  • �� 检索:利用FAISS索引快速检索偏好相关指令,导向内容生成。

实验设计

在四个偏好评估基准(PrefWiki、PrefRQ、PrefELI5、PrefEval)上,比较EPIC与BM25、Contriever、NV-Embed、RAPTOR、HippoRAG、Pref-QR和PBR等方法。指标包括存储空间、检索延迟和偏好跟随准确率。采用三平台(Jetson Nano、Mac M4、Galaxy Z Flip 6)进行硬件验证,参数设置如索引阈值和模型规模。通过 ablation 研究验证粗筛、验证和调节阶段的贡献,确保偏好对齐和存储压缩效果。

结果分析

EPIC在偏好跟随准确率方面显著优于基线,提升18.79个百分点,存储空间压缩达2404倍,检索延迟降低32.17倍。在三平台测试中,内存控制在1MB以内,响应时间在5.21-29.35毫秒之间。消融实验显示,粗筛阶段的语义距离过滤贡献最大,验证模型确保偏好匹配,偏好调节提升召回率。整体表现证明EPIC在极端资源限制下实现高效偏好个性化。

应用场景

EPIC可应用于移动端智能助手、物联网设备、隐私敏感场景的个性化推荐。只需少量偏好信息,即可实现高质量个性化响应,提升用户体验。未来还可结合偏好学习和动态更新,支持更复杂的多模态偏好建模,推动边缘AI的普及。

局限与展望

依赖预定义偏好集,难应对偏好动态变化;在噪声较大或偏好模糊场景下效果下降;模型验证和指令生成对硬件资源要求较高,需优化算法和模型结构。未来需探索偏好学习机制和更高效的指令生成策略。

通俗解读 非专业人士也能看懂

想象你有一个超级聪明的厨师助手,它能帮你准备每天的菜肴。这个助手需要记住你的口味偏好,比如喜欢辣的、喜欢素食或避免海鲜。可是厨房空间有限,不能存放所有食谱和偏好信息。于是,这个助手会先用一种聪明的方式快速筛掉那些你不喜欢的菜,然后再用更细致的方式确认剩下的菜是否符合你的口味。最后,它会根据你的偏好调整菜单,比如多放辣椒或少放盐。这样,助手就能在有限空间里,快速、准确地为你推荐最喜欢的菜肴。EPIC技术就像这个厨师助手,通过智能筛选、验证和调节,确保每次推荐都贴合你的偏好,又节省空间,效率极高。

简单解释 像给14岁少年讲一样

想象你有个超级帮手,他帮你整理书架。可是你的书太多,空间有限,不能全放进去。这个帮手会先用一种聪明的方法,把和你兴趣不相关的书先扔掉,然后再仔细检查剩下的书,确认它们是不是你喜欢的。最后,他会根据你的兴趣,把这些书摆得更合你心意,比如多放你喜欢的作者或类型。这样,空间就用在了最重要的书上,而且每次找书也更快。EPIC就像这个帮手,用智能筛选和调节,让设备记住你的偏好,又不占太多空间,帮你更方便地找到喜欢的内容。

术语表

Retrieval-Augmented Generation (检索增强生成)

一种结合外部知识检索与生成的技术,用于提升AI回答的准确性和丰富性。技术上通过检索相关内容,然后结合生成模型输出最终答案。

本文中用以在设备端结合偏好信息,提升个性化响应效果。

偏好对齐 (Preference Alignment)

确保检索和生成内容符合用户偏好的一种机制,避免偏离用户期望。技术上通过偏好相关的索引和调节实现。

EPIC的核心目标是实现偏好对齐,提升个性化体验。

语义空间 (Semantic Space)

通过向量表示文本内容的高维空间,反映内容的语义关系。相似内容在空间中距离较近。

用于筛选偏好相关内容的第一步。

指令生成 (Instruction Generation)

根据内容和偏好自动生成指导性指令,用于偏好导向的索引和检索。

EPIC中用以增强索引表达的准确性和偏好一致性。

偏好引导查询 (Preference-Guided Query)

将用户查询向偏好方向偏移的技术,以提高偏好相关的检索效果。

EPIC通过偏好引导提升偏好匹配率。

开放问题 这项研究留下的未解疑问

  • 1 如何在偏好动态变化时持续优化索引结构?偏好推断的准确性如何提升?未来如何结合多模态偏好信息?

应用场景

近期应用

移动端智能助手

在手机或智能音箱中部署EPIC,实现用户偏好个性化推荐,节省存储空间,提升响应速度。

隐私保护场景

在设备端存储偏好信息,避免上传敏感数据,保障用户隐私,适合金融、医疗等敏感行业。

远期愿景

智能边缘设备普及

推动EPIC在物联网、智能家居等场景中广泛应用,实现全场景个性化服务,减少云端依赖。

原文摘要

With the rapid emergence of personal AI agents based on Large Language Models (LLMs), implementing them on-device has become essential for privacy and responsiveness. To handle the inherently personal and context-dependent nature of real-world requests, such agents must ground their generation in device-resident personal context. However, under tight memory budgets, the core bottleneck is what to store so that retrieval remains aligned with the user. We propose EPIC (Efficient Preference-aligned Index Construction), which focuses on user preferences as a compact and stable form of personal context and integrates them throughout the RAG pipeline. EPIC selectively retains preference-relevant information from raw data and aligns retrieval toward preference-aligned contexts. Across four benchmarks covering conversations, debates, explanations, and recommendations, EPIC reduces indexing memory by 2,404 times, improves preference-following accuracy by 18.79 %p, and achieves 32.17 times lower retrieval latency over the best-performing baseline. In on-device experiments, EPIC maintains under 1 MB memory and achieves 5.21 to 29.35 ms/query latency across three platforms, while supporting streaming updates under preference drift. Our code and data are available at https://github.com/UbiquitousAILab/EPIC.

cs.CL cs.AI cs.IR cs.LG