Do LLM Debates Repeat Arguments Differently Across Languages?
研究发现中文辩论中重复性高于英文,提出“先前论点相似性”指标。
Huiqian Lai
研究发现中文辩论中重复性高于英文,提出“先前论点相似性”指标。
Huiqian Lai
UltraViT通过优化视觉编码器提高设备上大模型的速度,达到1.7倍提升。
Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati 等
IKS-Instruct构建了一个包含2.48万多语言、涵盖41项印度知识体系教学技术的指令-响应数据集,用于提升模型的文化深度和教学能力。
Shwetha Singaravelu, Gayathri Muruganantham, Lakshmi Rajendran 等
提出BHARATI,基于子词生育率分析的印度古典语言形态感知分词器,显著减少序列长度。
Poornima Kumaresan, Pavithra Muruganantham, Lakshmi Rajendran 等
提出TOPOFE,基于图结构多岛演化的AutoFE框架,显著提升分类与回归性能。
Sha Li, Naren Ramakrishnan
提出Co-E系统,利用同步双向图文本记忆实现无训练多跳问答,显著优于基线。
Hieu Man, Thien Huu Nguyen
提出X-Stage,软硬件可见的后发射流水线阶段,利用Burst-Gap模型优化DiT推理通信与计算重叠,提升GPU性能。
Jianwen Xian, Zhiyuan Xu, Yuchen Li 等
提出NOPD(无噪声学生自我蒸馏),无需外部模型或真值,利用预测差异实现自我提升。
Shuai Wang, Daoan Zhang, Zhe Tang 等
提出SQBench基准,评估语言模型在生产流程中的任务交付能力,涵盖220个任务,结合功能完成与风险评估。
Summer Sun
提出了高精度机器人操作的数据扩展定律,使用公式log(N) ∝ 1/(P-c)描述数据与精度的关系。
Cuijie Xu, Yuanfan Xu, Min Xue 等
SearchArt利用验证驱动的合成与多阶段微调,提升长远搜索策略,参数27B,达74.39分。
Lang Mei, Xiaohan Yu, Chong Chen 等
SAGE以风险优先架构治理AI全生命周期;840次调用显示风险估计低但仅限单轮协议。
Mahdi Eslamimehr
HAFS框架提高视频质量1.5倍,降低响应时间31%。
Goodsol Lee, Juheon Yi, Jinglu Wang 等
提出IDEAgent,基于质量-多样性搜索的科研创意生成框架,提升多样性与质量。
Varun Gumma, Navonil Majumder, Soumitra Sinhahajari 等
StateAct通过程序状态优先,显著提升长时程自动化任务成功率,成功率达26.9%。
Yan Yang, Xiangru Jian, Ziyang Luo 等
提出基于部署反馈的持续学习方法,利用外部记忆提升模型在τ-bench银行任务中的成功率,单次成功提升1.6倍,修正后达2.6倍。
Valentin Tablan, Scott Taylor, Kristoffer Bernhem
BrainAgent通过多轮推理和反思提升脑网络分析准确性。
Jiaxing Li, Rui Dong, Muyao Tang 等
本研究提出从零开始的多模态预训练规模规律,揭示模型大小和Token数的幂律关系。
Haoyuan Wu, Aoqi Wu, Hai Wang 等
提出MissionBench,基于深度仿真环境评估22个MLLM在无人机长时任务中的零样本能力,成功率不足35%。
Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt 等
VIGOR通过奖励方差引导,提升RLVR训练效率,减少2.3×采样量。
Heyang Jiang, Henry Liu, Baharan Mirzasoleiman