CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks
CommunityBench评估社区级别的模型对齐,揭示LLM在社区偏好建模中的局限性。
Jiayu Lin, Zhongyu Wei
CommunityBench评估社区级别的模型对齐,揭示LLM在社区偏好建模中的局限性。
Jiayu Lin, Zhongyu Wei
提出基于纳什社会福利的公平推荐算法,有效平衡匹配率与公平性。
Yoji Tomita, Tomohiko Yokoyama
提出以连贯性优化为核心的自我提升理论,证明其等价于描述长度正则化,支持半监督学习。
Tianyi Qiu, Ahmed Hani Ismail, Zhonghao He 等
提出RTCE基准,评估LLMs在代码逆向中的双向一致性,利用四种无损压缩算法实现精确匹配。
Nickil Maveli, Antonio Vergari, Shay B. Cohen
本文将Tokenization视为模型设计核心,提出上下文感知的联合设计框架,强调标准化评估。
Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar 等
WorldMind框架通过知识经验学习对齐代理世界模型,在EB-ALFRED上成功率提升至48.0%。
Baochang Ren, Yunzhi Yao, Rui Sun 等
本研究分析RAG系统在评估中泄露信息的风险,验证了泄露促使评分虚高的机制。
Laura Dietz, Bryan Li, Eugene Yang 等
综述以AlphaGeometry、FunSearch等为例,提出AI4Math应从形式验证走向数学发现。
Haocheng Ju, Bin Dong
FastAV通过两阶段剪枝策略减少AV-LLM推理的计算量40%以上。
Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee 等
HyFormer结合序列建模与特征交互,创新性引入全局Token,显著提升CTR预测性能。
Yunwen Huang, Shiyong Hong, Xijun Xiao 等
研究比较标准自编码器与掩码自编码器在音频异常检测中的表现,掩码自编码器提供更精确的解释。
Maab Elrashid, Anthony Deschênes, Cem Subakan 等
引入信息耕作概念,借比喻从采摘到耕作,强调生成式AI推动的主动信息生产。
Leif Azzopardi, Adam Roegiest
使用LongPAS方法提升长上下文推理能力,显著超越RLVR基线。
Miao Peng, Weizhou Shen, Nuo Chen 等
CTC-DID使用CTC损失函数实现阿拉伯语方言识别,在低资源环境中表现优异。
Muhammad Umar Farooq, Oscar Saz
EMoE引入正交特征基路由机制,有效平衡专家利用率与多样性,提升ImageNet准确率至88.14%。
Anzhe Cheng, Shukai Duan, Shixuan Li 等
提出多代理管道,将评论转化为可操作的商业建议,提升行动性和相关性。
Kartikey Singh Bhandari, Tanish Jain, Archit Agrawal 等
AVIR利用轻量检索和自适应筛选,减少70%页面,提升84.58% ANLS。
Zongmin Li, Yachuan Li, Lei Kang 等
提出SeLop方法,通过低秩正交投影抑制伪相关偏差,提升人脸伪造检测的泛化能力。
Chi Wang, Xinjue Hu, Boyu Wang 等
提出Uρ覆盖目标框架,结合相对熵与极小极大策略,优化MDP探索。
Xihe Gu, Urbashi Mitra, Tara Javidi
提出多种长上下文鲁棒的激活探针架构,提升模型误用检测性能。
János Kramár, Joshua Engels, Zheng Wang 等