daVinci-Dev: Agent-native Mid-training for Software Engineering
提出daVinci-Dev,通过代理原生中间训练,利用上下文和环境轨迹提升软件工程中的自主能力。
Ji Zeng, Dayuan Fu, Tiantian Mi 等
提出daVinci-Dev,通过代理原生中间训练,利用上下文和环境轨迹提升软件工程中的自主能力。
Ji Zeng, Dayuan Fu, Tiantian Mi 等
TriPlay-RL通过三角色自对抗强化学习实现LLM安全对齐,提升20%-50%攻击有效性。
Zhewen Tan, Wenhan Yu, Jianfeng Si 等
TEFormer通过双向时间融合提升脉冲Transformer的时空建模能力,在多数据集上表现优异。
Sicheng Shen, Mingyang Lv, Bing Han 等
通过多面体分解方法,提升ReLU网络的逼近能力,尤其在奇异点附近。
ZeYu Li, ShiJun Zhang, TieYong Zeng 等
Yunjue Agent通过并行批次演化和工具自我优化,实现零起点的开放任务适应,性能超越基准模型。
Haotian Li, Shijun Yang, Weizhen Qi 等
GAIA系统通过数据飞轮提升GUI测试时间扩展性能,显著改善操作准确性。
Shaokang Wang, Pei Fu, Ruoceng Zhang 等
提出ATLAS框架,结合降采样潜空间与本地投影,实现中期气象概率预测,超越传统模型。
Jean Kossaifi, Nikola Kovachki, Morteza Mardani 等
UniCog通过潜在心智空间分析揭示LLM的认知能力,提升推理性能7.5%。
Jiayu Liu, Yinhe Long, Zhenya Huang 等
SRA 2通过VAE特征对齐加速扩散模型训练,仅增加4% GFLOPs。
Mengmeng Wang, Dengyang Jiang, Liuzhuozheng Li 等
CoT-Seg结合链式推理与自我校正,无需微调,显著提升复杂场景下的图像分割性能。
Shiu-hong Kao, Chak Ho Huang, Huaiqian Liu 等
提出PPIA,基于视觉观察的黑箱物理提示注入攻击,成功率达98%。
Chen Ling, Kai Hu, Hangcheng Liu 等
提出三维QPP评估框架(SRMQ-PP、MRSQ-PP、MRMQ-PP),验证不同模型在多任务中的表现差异,结果显示传统分数模型在多模型任务中表现优越。
Payel Santra, Partha Basuchowdhuri, Debasis Ganguly
提出Reddit-Amazon-EM数据集,评估多种实体匹配方法,GNEM表现最佳。
Zihan Huang, Rohan Surana, Zhouhang Xie 等
提出了TAC和Soft-TAC方法,显著提高了奖励函数设计的效率和准确性。
Calarina Muslimani, Yunshu Du, Kenta Kawamoto 等
RPEval基准揭示个性化记忆对LLM行为的影响,RP-Reasoner方法显著减少不合理个性化。
Xueyang Feng, Weinan Gan, Xu Chen 等
本研究评估LLM模拟用户在τ-Bench中的表现,发现其在鲁棒性、有效性和公平性方面存在显著缺陷,成功率差异达9个百分点。
Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde 等
提出CORD,通过在线跨模态自蒸馏,利用文本作为内在教师,有效缩小音频-文本推理差距。
Jing Hu, Danxiang Zhu, Xianlong Luo 等
分析浅层Transformer的梯度下降,发现宽度与样本数量对数增长,优化误差与序列长度无关。
Enes Arda, Semih Cayci, Atilla Eryilmaz
通过深度绑定虚拟人设,结合时间和背景信息,提升LLMs在社会决策模拟中的一致性和真实性。
Suhong Moon, Minwoo Kang, Joseph Suh 等
提出DSGym框架,通过模块化设计实现数据科学代理的端到端评估与训练,涵盖多领域任务。
Fan Nie, Junlin Wang, Harper Hua 等