Transferability Between Understanding and Generation in Unified Multimodal Models
本研究分析统一多模态模型中的理解与生成任务的迁移性,发现全共享Transformer架构表现最佳。
Jiwon Kang, Heeji Yoon, Jaewoo Jung 等
本研究分析统一多模态模型中的理解与生成任务的迁移性,发现全共享Transformer架构表现最佳。
Jiwon Kang, Heeji Yoon, Jaewoo Jung 等
提出LLM作为导师框架,通过pairwise比较和原子约束递增难度,提升非可验证RL性能。
Yujin Kim, Namgyu Ho, Sangmin Hwang 等
研究探讨GUI代理对像素与结构的依赖,提出Perception-Fusion Gap指标。
Guijia Zhang, Yuxun Chen, Yuheng Qi 等
提出RZDG数据集与基于追踪的地理定位方法,提升道路施工区检测与全球定位精度。
Zhiran Yan, Yutong Xin, S Shyam Shenoi 等
AdaptiveSplat通过纹理感知控制3D高斯分配,提升稀疏重建质量。
Badrinath Singhal, Srihari K G, Sreehari Iyer 等
结合量化目标模型和推测解码,Qwen3.5-4B在NVIDIA A10G上实现6.978倍加速。
Jaeyeon Kim, Jewon Lee, Bo-Kyeong Kim
Agentic IoT通过自主AI代理实现IoT的认知转型,提升实时推理和自适应规划能力。
Rümeysa Hilal Sevinç, Bahaeddin Türkoğlu, İbrahim Kök
提出基于合同的分布式MPC,实现多机器人自主避碰的即插即用控制框架。
Sabrina Bodmer, Danilo Saccani, Melanie N. Zeilinger 等
MRAC方法在无参数增加的情况下,显著提高了深度估计的鲁棒性。
Sohag Roy, Rajesh Misra, Swami Shastravidyananda 等
CrossHallu评估多语言和领域中大模型内部信号的泛化能力,发现大部分模型在跨语言和跨领域迁移中表现良好。
Aisha Alansari, Malak Alkhorasani, Hamzah Luqman
提出MANCE方法,基于流形约束实现概念消除,提升信息保留效果。
Matan Avitan, Yoav Goldberg, Yanai Elazar
提出WSA1,基于3D世界-空间-动作联合建模,数据仅用6千小时示范实现高效泛化。
Jiahao Jiang, Jianing Zhang, Zhenhan Yin 等
AdaptiveSD框架通过多策略编排实现CPU受限环境下大模型推理的稳定性和自适应性。
Sadra Saremi
ObjRetarget结合人类视频,利用多面体手模型与肢体约束实现高精度机器人手臂与手部运动重定向。
Yuanchuan Lai, Qing Gao, Ziyan Liang 等
GLLS为工业异常检测提出无训练框架,结合全局逻辑与局部搜索,显著提升检测准确性。
Runzhi Deng, Yundi Hu, Yiming Zhong 等
提出基于高置信深度传播与法线先验的稀疏视角表面重建方法,显著优于现有技术。
Liang Han, Bangcai Wei, Junsheng Zhou 等
BRAID将多模态推理作为统一马尔可夫决策过程,通过联合优化文本与图像生成,显著提升多轮交互性能。
Zican Hu, Xuyang Hu, Yiming Liu 等
CoRE-VLA模型通过条件专家路由实现了视觉-语言-动作的可扩展和鲁棒建模,在多任务和长时间任务中表现优异。
Haozhe Zhang, Sixian Li, Yifei Zhang 等
AdaptiveSpec通过动态调整草稿树形状和松散验证规则,实现推理速度提升56%,准确率恢复93%。
Oszkár Urbán, Young D. Kwon, Stylianos I. Venieris 等
提出统一手动作空间(UHAS),实现跨平台灵巧操作,实验表明在不同手型间有效转移。
Luis Felipe Casas, Robert Teal, Keval Shah 等