EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer
EvoAgentBench通过能力转移评估代理自我进化,涵盖四个领域,揭示自动方法的局限性。
Xingze Gao, Chuanrui Hu, Hongda Chen 等
EvoAgentBench通过能力转移评估代理自我进化,涵盖四个领域,揭示自动方法的局限性。
Xingze Gao, Chuanrui Hu, Hongda Chen 等
提出Audex,基于Nemotron-Cascade-2-30B-A3B的统一音频文本大模型,实现音频理解、识别、翻译及生成,保持文本推理能力。
Zhifeng Kong, Sang-gil Lee, Jaehyeon Kim 等
UNIVERSE采用单一掩码调制的Diffusion Transformer,结合视频与轨迹,提升自主驾驶动作泛化,速度提升4.3倍。
Mengmeng Liu, Diankun Zhang, Jiuming Liu 等
提出多尺度卷积和动态路由模型,提升视频文本时间定位准确率,达42.9%召回率。
Gengtian Shi, Jinze Yu, Chenhao Wu 等
RADIANCE利用CLIP反馈调节扩散模型,提升稀有概念生成的准确性。
Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao 等
HunyuanOCR-1.5通过DFlash加速和Agentic Data Flow提升OCR性能,达到6.37倍推理速度提升。
Gengluo Li, Xingyu Wan, Shangpin Peng 等
利用深度限制重建评分的无监督检测地下隧道方法,AUC达到0.994。
Muhammad Junaid, Shoab A. Khan, Nisar Ahmed
PRISM通过单图像和自然指令生成个性化机器人数据,构建语义几何对齐的数字场景。
Dogyu Ko, Haneul Kim, Chanyoung Yeo 等
提出MECo-WAM,通过训练引入4D几何先验,提升机器人操控精度,保持低推理成本。
Jianjun Zhang, Jian Zhu, Taiyi Su 等
GeoMoLa通过预测点云演变学习运动潜在编码,单视角RGB-D输入下实现最先进性能。
Yunchao Zhang, Yijia Weng, Ruizhe Liu 等
提出FocusGS,通过目标结构补全技术,减少74%的高斯数,提升稀疏视角3D重建效率与质量。
Guoqing Wang, Pin Tang, Xiangxuan Ren 等
PixelPilot通过2D规划和推Lift实现端到端自主驾驶,提升数据可扩展性和视觉推理。
Pin Tang, Guoqing Wang, Xiangxuan Ren 等
HIEVI-RAG框架通过分层证据驱动推理提高长文档理解准确率8.05%。
Junyu Xiong, Yonghui Wang, Rongjian Gu 等
G2VD结合反事实干预与因果解缠,实现视频伪造检测的跨域泛化。
Meng Du, Hongchang Chen, Ran Li 等
通过分类器判别分数(CDS)方法,解决单细胞扰动数据的类重叠问题,显著提高识别准确率。
Youssef Marrakchi, Davide D'Ascenzo, Sebastiano Cultrera di Montesano
提出MTEB-BR基准,涵盖22个本土任务,评估93个模型,采用统计分析区分模型层级。
Tardelli Ronan Coelho Stekel
Flash-BoN通过时间步截断、层跳过和激活代理生成草稿候选,提升生成效率和质量,AUC提高8%。
Ruchit Rawal, Reza Shirkavand, Sayak Paul 等
dOPSD方法通过自我蒸馏提高扩散语言模型的推理能力,在Dream和LLaDA上表现优异。
Phuong Tuan Dat, Qi Li, Xinchao Wang
本研究分析统一多模态模型中的理解与生成任务的迁移性,发现全共享Transformer架构表现最佳。
Jiwon Kang, Heeji Yoon, Jaewoo Jung 等
提出LLM作为导师框架,通过pairwise比较和原子约束递增难度,提升非可验证RL性能。
Yujin Kim, Namgyu Ho, Sangmin Hwang 等