Emergent Language as an Approach to Conscious AI
提出基于多智能体强化学习的涌现语言方法,观察无先验条件下的意识相关结构,发现自指通信和回声检测电路。
Zengqing Wu, Chuan Xiao
提出基于多智能体强化学习的涌现语言方法,观察无先验条件下的意识相关结构,发现自指通信和回声检测电路。
Zengqing Wu, Chuan Xiao
引入数据快照提取基准,评估开源布局检测模型在机构文件中的表现,发现模型在实际应用中存在较大差距。
AJ Carl P. Dy, Aivin V. Solatorio
IR3DE基于岭回归的线性路由器,快速低成本支持多领域大模型选择,性能达98.4%。
Eros Fanì, Oğuzhan Ersoy
MARDoc通过结构化记忆实现多模态长文档问答,显著提升多跳推理性能。
Kaifeng Chen, Hongtao Liu, Qiyao Peng 等
AdaPLD通过自适应检索和重用实现高效解码,速度提升3.10倍。
Runheng Liu, Jincheng Xie, Wen Hu 等
提出α-STOP方法,在对话和LLM代理轨迹中实现早期失败预警,提升1-42%的前沿质量。
Avinash Baidya, Xinran Liang, Ruocheng Guo 等
提出PERSUASIONTRACE框架,使用贝叶斯网络模拟多轮人类信念更新,得分接近人类(81 vs 80)。
Jared Moore, Noah Goodman, Nick Haber 等
Depth-Attention通过跨层值混合提升语言模型性能,提升准确率达2.3个百分点。
Boyi Zeng, Yiqin Hao, Zitong Wang 等
LifeSide通过多会话Memory-Emotion-Environment循环,评估数字伴侣的长期记忆与情感支持能力。
Yuqian Wu, Zhijie Deng, Wei Chen 等
RAMPART通过优先级感知的运行时转换优化LLM代理的内存模型,提升任务成功率。
Nikodem Tomczak
VCIFBench评估视频理解中复杂指令遵循,涵盖306个任务,强调多约束满足难题。
Huangchen Xu, Yuan Wu, Yi Chang
提出一种难度感知的SFT-then-RL框架,提升小型语言模型推理能力。
Chongyang He, Rui Zhang, Zixuan Wang 等
SEA-Embedding采用对比学习和相似度匹配,基于公开数据实现东南亚语言鲁棒文本嵌入,达成SOTA。
Peerat Limkonchotiwat, Raymond Ng, Sarana Nutanong 等
提出SubFit方法,在LLM中以非连续子模块级别替换,显著提升压缩效果,25%稀疏下保持84.6%准确率。
Elia Cunegatti, Marcus Vukojevic, Erik Nielsen 等
提出脚本归一化的WER(SN-WER),在五种印地语系语言中通过转写减少多达12%的脚本偏差影响,提升多脚本ASR评估的准确性。
Priyaranjan Pattnayak
SimSD采用插拔式掩码策略,为扩散式大语言模型引入令时间有效的逐词验证,实现最高7.46倍的解码吞吐提升。
Junxia Cui, Haotian Ye, Runchu Tian 等
PaSBench-Video是一个740视频的基准,用于测试视频多模态大模型的主动安全警告能力,严格指标下无模型超过20.0%。
Yusong Zhao, Yuejin Xie, Youliang Yuan 等
DFlare通过层级融合机制提升草稿模型能力,实现LLM推理加速,平均加速5倍以上。
Jiebin Zhang, Zhenghan Yu, Song Liu 等
DocFormFlow提高格式准确性72.53%,减少令牌消耗。
Shihao Rao, Liang Li, Jiapeng Liu 等
提出“Decan”指标,通过单次前向传递基模型的对数概率,衡量AI与人类输出的多样性,验证在McDiv基准中达0.846。
Matthew Khoriaty, David Williams-King, Shi Feng