VeriSciQA: An Auto-Verified Dataset for Scientific Visual Question Answering
提出Cross-Modal验证框架,构建VeriSciQA,涵盖20200+高质量科学图表问答数据。
Yuyi Li, Daoyuan Chen, Zhen Wang 等
提出Cross-Modal验证框架,构建VeriSciQA,涵盖20200+高质量科学图表问答数据。
Yuyi Li, Daoyuan Chen, Zhen Wang 等
GigaWorld-0结合视频生成与3D建模,作为数据引擎提升 embodied AI 的泛化能力。
GigaWorld Team, Angen Ye, Boyuan Wang 等
提出高效可迁移的最优传输方法——Min-Sliced Transport Plans,提升多任务匹配效率。
Xinran Liu, Elaheh Akbari, Rocio Diaz Martin 等
Zhang等提出IF-Edit,无需微调,利用预训练视频扩散模型实现指令驱动的图像编辑,提升非刚性和推理任务表现。
Zechuan Zhang, Zhenyuan Chen, Zongxin Yang 等
提出COVT框架,通过连续视觉令牌增强VLM的空间推理能力,提升性能达16%。
Yiming Qin, Bomin Wei, Jiaxin Ge 等
提出RLER方法,结合搜索与演化的评判标准,训练深度研究模型DR Tulu-8B,性能优于现有开源模型。
Rulin Shao, Akari Asai, Shannon Zejiang Shen 等
本研究系统评估多语模型在跨语信息检索中的表现,发现多语嵌入和对比学习优于翻译方法。
Roksana Goworek, Olivia Macmillan-Scott, Eda B. Özyiğit
LAST通过视觉链路增强空间与时间推理,提升VLM在3D和长视频理解中的表现。
Shuai Wang, Daoan Zhang, Tianyi Bai 等
SENTINEL模型实现语言到动作的端到端控制,成功率达99.45%。
Yuxuan Wang, Haobin Jiang, Shiqing Yao 等
利用Lehmer码在排列空间中进行演化算法的理论分析与实证验证,揭示其效率优势。
Yuxuan Ma, Valentino Santucci, Carsten Witt
提出距离多样化Top-k子图匹配(DTkSM)及分区框架,显著提升匹配效率和多样性。
Liuyi Chen, Yuchen Hu, Zhengyi Yang 等
提出ViCoDR,通过多视角一致性学习显著提升视频3D一致性。
Duolikun Danier, Ge Gao, Steven McDonagh 等
提出视觉-语言程序(VLP),结合VLM的感知灵活性与程序合成的系统推理,显著提升复杂逻辑推理性能。
Antonia Wüst, Wolfgang Stammer, Hikaru Shindo 等
Nemotron-Flash通过优化深度-宽度比和运算符选择,显著提高小语言模型的延迟和吞吐量。
Yonggan Fu, Xin Dong, Shizhe Diao 等
提出DLR框架,通过信息论方法在VLA预训练中生成多样高成功策略,显著提升模型泛化。
Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang 等
HuggingR$^4$提出渐进推理框架,优化模型选择,提升准确率至92.03%,减少令牌消耗6.9倍。
Shaoyin Ma, Chenggong Hu, Huiqiong Wang 等
提出自适应视觉基模块,通过正交滤波减少视觉token数量,实现更高效的表示学习。
Shawn Young, Xingyu Zeng, Lijian Xu
使用CNN估计相机姿态,定位扫描图像,实现飞机视觉检查,误差小于0.24米和2度。
Xueyan Oh, Leonard Loh, Shaohui Foong 等
SAMBA模型通过空间嵌入和差分Mamba实现长时间EEG建模,显著提升准确率。
Jiazhen Hong, Geoffrey Mackellar, Soheila Ghane
Splatblox通过高斯喷洒实现户外机器人导航,成功率提高50%。
Samarth Chopra, Jing Liang, Gershom Seneviratne 等