LightMem: Lightweight and Efficient Memory-Augmented Generation
LightMem结合人类记忆模型,分三阶段优化长时记忆,提升效率与准确率。
Jizhan Fang, Xinle Deng, Haoming Xu 等
LightMem结合人类记忆模型,分三阶段优化长时记忆,提升效率与准确率。
Jizhan Fang, Xinle Deng, Haoming Xu 等
提出企业深度研究(EDR)框架,结合多智能体系统实现企业级自主研究,超越SOTA,性能优异。
Akshara Prabhakar, Roshan Ram, Zixiang Chen 等
FARE使用迭代拒绝采样SFT方法,在推理领域超越70B+评估器。
Austin Xu, Xuan-Phi Nguyen, Yilun Zhou 等
使用LLM驱动的工业代理实现复杂任务的自动化,提升生产力。
Yihong Tang, Kehai Chen, Liang Yue 等
提出StreamingThinker,实现LLMs边读边思,减少80%等待时间。
Junlong Tong, Yingqi Fan, Anhao Zhao 等
基于背包问题的自动代理组合框架,通过动态测试优化组件选择,提升成功率与成本效率。
Michelle Yuan, Khushbu Pahwa, Shuaichen Chang 等
提出基于激活的置信度估计方法,提升LLM在金融等高风险场景的可信性,准确率达95%。
Zhiqi Huang, Vivek Datla, Chenyang Zhu 等
本研究提出模型在辩论中更倾向于支持与自身信念一致的立场,采用序贯与同步两种协议,结果显示模型在偏好一致时更具说服力。
María Victoria Carro, Denise Alejandra Mester, Facundo Nieto 等
提出Omni-Detective数据管线和Omni-Captioner模型,提升多模态细粒度感知能力。
Ziyang Ma, Ruiyang Xu, Zhenghao Xing 等
DELTA通过层级选择机制提升长文本推理效率,速度提升1.54倍,保持或超越全注意力准确率。
Hossein Entezari Zarch, Lei Gao, Chaoyi Jiang 等
提出SIMBA UQ框架,利用样本相似性实现大模型不确定性量化,提升校准度。
Debarun Bhattacharjya, Balaji Ganesan, Junkyu Lee 等
提出Translation Tangles框架,结合多语言评估和偏见检测,分析24对语言对的翻译性能与偏见。
Md. Faiyaz Abdullah Sayeedi, Md. Mahbub Alam, Subhey Sadi Rahman 等
提出PA-Tool,通过峰值性指标无训练调整模型偏好,实现工具命名对齐,提升17%准确率。
Jonggeun Lee, Woojung Song, Jongwook Han 等
提出Customer-R1,基于RL的个性化用户行为模拟方法,显著优于基线,提升预测准确率。
Ziyi Wang, Yuxuan Lu, Yimeng Zhang 等
SUPO算法通过总结管理扩展LLM多轮强化学习,提升成功率并降低上下文长度。
Miao Lu, Weiwei Sun, Weihua Du 等
使用中心核对齐和方差度量分析SSM和TBM的表示传播,揭示其层间信息流动差异。
Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen 等
提出UserLMs,模拟多轮对话中人类用户行为,GPT-4o性能从74.6%降至57.4%。
Tarek Naous, Philippe Laban, Wei Xu 等
提出SimulatorArena,基于用户画像的模拟器实现多轮评估,达ρ=0.7,替代人工评估。
Yao Dou, Michel Galley, Baolin Peng 等
即使完美检索,长上下文仍损害LLM性能,提出缩短上下文的策略提升性能。
Yufeng Du, Minyang Tian, Srikanth Ronanki 等
提出RE-Searcher,结合目标导向规划与自我反思,显著提升搜索鲁棒性与准确率。
Daocheng Fu, Jianbiao Mei, Licheng Wen 等