LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
LifeSim通过BDI模型模拟用户认知,提升个性化助手评估。
Feiyu Duan, Xuanjing Huang, Zhongyu Wei
LifeSim通过BDI模型模拟用户认知,提升个性化助手评估。
Feiyu Duan, Xuanjing Huang, Zhongyu Wei
MDER-DR框架通过实体中心的摘要提高多跳问答性能,提升66%。
Riccardo Campi, Nicolò Oreste Pinciroli Vago, Mathyas Giudici 等
IsalGraph方法将有限简单图表示为九字符指令字母表上的紧凑字符串,适用于图相似性搜索。
Ezequiel Lopez-Rubio, Mario Pascual-Gonzalez
GLM-OCR结合CogViT视觉编码器和GLM语言解码器,提升文档理解效率。
Shuaiqi Duan, Yadong Xue, Weihan Wang 等
我们发布了一个大型双语图书馆目录数据集,支持基于GND的多标签分类。
Jennifer D'Souza, Sameer Sadruddin, Maximilian Kähler 等
通过LLM辅助生成MIPVU规则脚本,实现可解释的中文隐喻识别,跨协议比较显示协议选择是主要变异来源。
Weihang Huang, Mengna Liu
OpenClaw-RL通过异步架构利用下一状态信号实现在线个性化和通用智能体训练,融合评估与指令信号。
Yinjie Wang, Xuyang Chen, Xiaolong Jin 等
引入DOWIS数据集,评估语音大语言模型在多语言环境下的指令跟随能力,发现文本提示优于语音提示。
Maike Züfle, Sara Papi, Fabian Retkowski 等
N-gram模型在预测阅读时间上表现最佳,因其对简单统计更敏感。
James A. Michaelov, Roger P. Levy
提出StateFactory,通过层次化对象-属性结构实现跨域奖励预测,零-shot EPIC距离降低60%。
Yijun Shen, Delong Chen, Xianming Hu 等
提出结合自适应循环和记忆库的Transformer模型,在数学推理任务中性能提升22%,常识任务恢复性能。
Markus Frey, Behzad Shomali, Ali Hamza Bashir 等
Ramsa语料库提供阿联酋阿拉伯语的ASR和TTS基线,Whisper-large-v3-turbo表现最佳。
Rania Al-Sabbagh
提出LongNAP,结合参数和检索机制,基于360K行为数据,利用策略梯度训练,显著优于基线模型。
Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi 等
提出多语云语料库,涵盖孟加拉民族语言,结合系统田野采集与IPA转录,推动低资源语言数字化。
Mohammad Mamun Or Rashid
提出IF-RewardBench,构建多样化指令和偏好图,显著评估判别模型性能。
Bosi Wen, Yilin Niu, Cunxiang Wang 等
GOLF通过整合群组级自然语言反馈提升强化学习探索效率,样本效率提升2.2倍。
Lei Huang, Xiang Cheng, Chenxiao Zhao 等
SafeCRS通过Safe-SFT和Safe-GDPO实现个性化安全对齐,显著降低安全违规率。
Haochang Hao, Yifan Xu, Xinzhuo Li 等
BeyondSWE基准评估代码智能在跨仓库、领域知识、依赖迁移和文档生成中的表现,最佳模型仅达56.65分。
Guoxin Chen, Fanzhe Meng, Jiale Zhao 等
本文系统分析了多种块级缓存(CLC)策略的局限性与互补性,提出结合技术提升准确率。
Samuel Cestola, Tianxiang Xia, Zheng Weiyan 等
RLAR利用LLM自主检索和合成奖励模型,提升多任务强化学习性能10-60%。
Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen 等