WebDancer: Towards Autonomous Information Seeking Agency
提出WebDancer,基于ReAct的端到端自主信息搜索模型,显著提升在GAIA和WebWalkerQA的表现。
Jialong Wu, Baixuan Li, Runnan Fang 等
提出WebDancer,基于ReAct的端到端自主信息搜索模型,显著提升在GAIA和WebWalkerQA的表现。
Jialong Wu, Baixuan Li, Runnan Fang 等
提出正交和方差损失提升MoE专家专精,性能提升23.79%。
Hongcan Guo, Haolang Lu, Guoshun Nan 等
ACE-Step结合扩散模型、DCAE和线性Transformer,实现4分钟音乐20秒生成,提升速度和连贯性。
Junmin Gong, Sean Zhao, Sen Wang 等
BioHopR是基于PrimeKG的多跳、多答案生物医学知识图谱问答基准,评估模型推理能力。
Yunsoo Kim, Yusuf Abdulle, Honghan Wu
LCoT2Tree将长思维链转为树结构,GNN准确率平均提升5.63%。
Gangwei Jiang, Yahui Liu, Zhaoyi Li 等
AudioGenie:无训练多代理框架,实现多模态到多音频生成,性能领先。
Yan Rong, Jinting Wang, Guangzhi Lei 等
EPiC通过遮罩源视频实现高精度锚点视频,无需点云或相机姿态估计,提升3D相机控制效率。
Zun Wang, Jaemin Cho, Jialu Li 等
BehaviorSFT通过行为标记提升临床代理的主动性,BehaviorBench上Macro F1达97.3%。
Yubin Kim, Zhiyuan Hu, Hyewon Jeong 等
提出ViewSpatial-Bench,评估多视角空间定位,模型性能提升46.24%。
Dingming Li, Hongxing Li, Zixuan Wang 等
本研究评估LLMs在医学文本摘要中的表现,强调词汇适应对高OOV场景的提升。
Gunjan Balde, Soumyadeep Roy, Mainack Mondal 等
本研究通过控制自信与信息格式,揭示LLM多智能体中的群体行为机制,发现低自信高感知信心促成从众。
Young-Min Cho, Sharath Chandra Guntuku, Lyle Ungar
LLaMEA-BO利用大语言模型自动生成贝叶斯优化算法,提升19个BBOB函数性能。
Wenhu Li, Niki van Stein, Thomas Bäck 等
提出Fork-Merge Decoding方法,在不额外训练下提升音视频大模型的多模态理解。
Chaeyoung Jung, Youngjoon Jang, Jongmin Choi 等
AVCD通过对比解码减少音视频大语言模型中的幻觉,提升了AVHBench数据集上的准确率。
Chaeyoung Jung, Youngjoon Jang, Joon Son Chung
通过混合安全计算保护隐私的P2P能源交易方法,使用Paillier加密和秘密共享。
Junhong Liu, Qinfei Long, Rong-Peng Liu 等
提出SWE-rebench自动化任务采集与去污染评估框架,构建超2万交互式Python任务。
Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich 等
EgoZero利用Project Aria智能眼镜实现零样本从野外人类演示中学习机器人操控策略,无需机器人数据,采用点云表示增强泛化能力。
Vincent Liu, Ademi Adeniji, Haotian Zhan 等
Alita采用极简预定义和自我演化策略,达成75.15% pass@1,突破复杂系统性能。
Jiahao Qiu, Xuan Qi, Tongcheng Zhang 等
提出ImgEdit数据集与基准,结合多阶段管线训练高质量图像编辑模型,显著优于现有方法。
Yang Ye, Xianyi He, Zongjian Li 等
提出基于logit的集成方法,匹配人类对LLM一致性的评估。
Xiaoyuan Wu, Weiran Lin, Omer Akgul 等