MOFA-VTON: More Fashion Possibilities with Fine-Grained Adaptations in Virtual Try-On
提出MOFA-VTON,通过用户草图实现细粒度虚拟试衣,超越传统布局限制。
Xiaoyu Han, Chenyang Wang, Jing Wang 等
提出MOFA-VTON,通过用户草图实现细粒度虚拟试衣,超越传统布局限制。
Xiaoyu Han, Chenyang Wang, Jing Wang 等
基于Prolog的神经符号技能实现LLM引导的服务部署,提升可解释性与合规性。
Jacopo Massa, Giuseppe Bisicchia, Patrizio Dazzi 等
本文提出基于描述符的分布式多地面机器人(UGV)探索框架,结合环路检测和层次规划,显著提升资源有限环境中的探索效率与定位精度,关键指标AR@1达89.9%。
Zhiwei Li, Haiou Liu, Xijun Zhao 等
VISTA引入融合UI与API的混合用户模拟器,采用六项指标评估交互真实性与能力覆盖,显著优于现有方法。
Yunan Lu, Ryan Shea, Yusen Zhang 等
提出HiViG,结合历史状态追踪与视觉基础的测试时干预框架,提升GUI任务成功率,Qwen3-VL-32B提升5.8%,Gemini-3-Flash提升9%。
Jaewoo Lee, Zaid Khan, Archiki Prasad 等
本文提出基于演化替代矩阵的灵活核函数,利用高效高斯过程模型预测蛋白质性质,显著优于嵌入基础模型的方案。
Martin Jankowiak, Yerdos Ordabayev, Rudraksh Tuwani 等
本文提出基于大语言模型(LLM)的自主驾驶成本优化框架,通过自然语言交互实现动态调节,结合MPPI控制实现安全与个性化驾驶。
Diego Martinez-Baselga, Khaled Mustafa, Javier Alonso-Mora
提出WorldKernel模型,利用正半定核捕捉未识别的反事实世界耦合,解决预测无法表达不确定性的问题。
Fabio Rovai
Pose-ICL通过3D感知的上下文学习实现姿态可控的主体定制,显著提高姿态准确性和身份一致性。
Xuan Han, Yihao Zhao, Mingyu You
MV-Actor通过多视角语义交互和语义-空间令牌交互实现87.8%的成功率。
Yinchen Tian, Huan Li, Muyao Peng 等
KATE框架通过整合经验知识和扩展推理宽度,提升LLM工具调用性能,在BFCL-V3上提升15%。
Yupu Hao, Zhuoran Jin, Huanxuan Liao 等
采用因式分解的时空编码与神经样条流,实现短时噪声图像序列中CWBs参数反演。
Niklas Knöll, Tobias Buck, Lorenzo Branca 等
miniReranker通过视觉缓存重用和交互稀疏技术,在多模态重排序中实现了<1%的运行时间,性能保持在96%以上。
Yingqi Fan, Xuan Lu, Anhao Zhao 等
提出基于预测门控的银行级稀疏训练方法,将Dense模型转化为4倍稀疏的LLM,提升长文本处理效率。
Ruixuan Huang, Jinyuan Shi, Hantao Huang 等
REAL采用时间与置信度感知的图结构,有效管理LLMs的长时记忆,提升22.72%。
Keer Lu, Liwei Chen, Guoqing Jiang 等
提出多尺度残差感知框架,结合Transformer模型实现时间序列预测,显著降低偏差。
Amrijit Biswas, Mustafa Kamal, Robin Krambroeckers 等
提出技能覆盖率指标,基于轨迹检测技能行为约束,平均覆盖率38.66%-45.51%,提升失败任务16%。
Boyin Tan, Xiaowei Huang, Youcheng Sun
VeriSpace利用双路径3D场景编码和空间推理提升VLA模型的动作验证可靠性。
Guiyu Zhao, Longteng Guo, Junyou Zhu 等
SkillAxe通过自我优化提升LLM技能,通过28%提高通过率。
Srishti Gautam, Arjun Radhakrishna, Sumit Gulwani
GUI-AC方法通过自适应优势和动态剪辑提升GUI代理的持续学习能力。
Can Lin, Tao Feng, Hangjie Yuan 等