LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
LifeSim simulates user cognition via BDI model to enhance personalized assistant evaluation.
Feiyu Duan, Xuanjing Huang, Zhongyu Wei
LifeSim simulates user cognition via BDI model to enhance personalized assistant evaluation.
Feiyu Duan, Xuanjing Huang, Zhongyu Wei
MDER-DR framework enhances multi-hop QA with entity-centric summaries, achieving 66% improvement.
Riccardo Campi, Nicolò Oreste Pinciroli Vago, Mathyas Giudici et al.
IsalGraph method encodes any finite simple graph as a compact string over a nine-character instruction alphabet, suitable for graph similarity search.
Ezequiel Lopez-Rubio, Mario Pascual-Gonzalez
GLM-OCR combines CogViT visual encoder and GLM language decoder to enhance document understanding efficiency.
Shuaiqi Duan, Yadong Xue, Weihan Wang et al.
We release a large bilingual library dataset for GND-based multi-label classification.
Jennifer D'Souza, Sameer Sadruddin, Maximilian Kähler et al.
LLM-assisted MIPVU rule script generation enables interpretable Chinese metaphor identification; protocol choice is the main source of variation.
Weihang Huang, Mengna Liu
OpenClaw-RL employs an asynchronous architecture to leverage next-state signals for online personalized and general agent training, integrating evaluative and directive signals.
Yinjie Wang, Xuyang Chen, Xiaolong Jin et al.
Introduced DOWIS dataset to evaluate SLLMs in multilingual settings, finding text prompts outperform spoken prompts.
Maike Züfle, Sara Papi, Fabian Retkowski et al.
N-gram models predict reading time best due to sensitivity to simple statistics.
James A. Michaelov, Roger P. Levy
StateFactory uses hierarchical object-attribute structures for zero-shot reward prediction, reducing EPIC distance by 60%.
Yijun Shen, Delong Chen, Xianming Hu et al.
Introduces adaptive looping and memory banks in Transformers, achieving 22% math BPB improvement and recovering commonsense performance.
Markus Frey, Behzad Shomali, Ali Hamza Bashir et al.
Ramsa corpus provides baseline ASR and TTS for Emirati Arabic; Whisper-large-v3-turbo excels.
Rania Al-Sabbagh
LongNAP combines parametric and retrieval mechanisms, trained with policy gradients on 360K actions over 1,800 hours, outperforming baselines significantly.
Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi et al.
Introduced Multilingual Cloud Corpus, a structured, parallel, multimodal dataset of 42 Bangladeshi minority languages, enabling low-resource NLP applications.
Mohammad Mamun Or Rashid
Proposed IF-RewardBench, a comprehensive benchmark using preference graphs for instruction-following evaluation, revealing significant deficiencies in current judge models.
Bosi Wen, Yilin Niu, Cunxiang Wang et al.
GOLF leverages group-level natural language feedback to boost RL exploration, achieving 2.2× sample efficiency.
Lei Huang, Xiang Cheng, Chenxiao Zhao et al.
SafeCRS employs Safe-SFT and Safe-GDPO to achieve personalized safety alignment, reducing violations by 96.5% while maintaining recommendation quality.
Haochang Hao, Yifan Xu, Xinzhuo Li et al.
BeyondSWE benchmark evaluates code agents on cross-repository, domain-specific, dependency migration, and document generation tasks; top model scores 56.65, still far from saturation.
Guoxin Chen, Fanzhe Meng, Jiale Zhao et al.
This paper systematically analyzes limitations and complementarities of chunk-level cache (CLC) strategies, proposing a combined approach to improve accuracy.
Samuel Cestola, Tianxiang Xia, Zheng Weiyan et al.
RLAR uses LLMs to autonomously retrieve and synthesize reward models, improving multi-task RL performance by 10-60%.
Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen et al.