MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents
MementoGUI通过学习多模态记忆控制器提升长时序GUI代理性能,显著改善任务成功率。
Ziyun Zeng, Hang Hua, Bocheng Zou 等
MementoGUI通过学习多模态记忆控制器提升长时序GUI代理性能,显著改善任务成功率。
Ziyun Zeng, Hang Hua, Bocheng Zou 等
提出语义-空间解耦Transformer,有效解决NVS中的表示歧义,提升渲染质量。
Yihang Wu, Yihang Sun, Shaofeng Zhang 等
StableHand通过质量感知流匹配框架从第一视角视频中估计双手运动,W-MPJPE降低20-25%。
Huajian Zeng, Chaohua Yao, Yuantai Zhang 等
SGSoft通过模板引导的软信号学习融合语义-几何特征,实现3D形状对应,达到最先进的跨类别泛化能力。
Soyeon Yoon, Chang Wook Seo, Hyunjung Shim
Generation Navigator通过PRE-GRPO优化图像生成,WISE得分0.90。
Jinming Liu, Ruoyu Feng, Yuqi Wang 等
EPIC-Bench通过6.6k标注样本,系统评估视觉-语言模型在细粒度实体定位、导航和操控中的感知能力。
Haozhe Shan, Xiancong Ren, Han Dong 等
VGGT-Occ通过几何嵌入和密度感知门控融合提升3D占据预测,达到33.64% IoU。
Xun Chen, Tianchen Deng, Rui Wang 等
WOW-Seg采用Mask2Token和级联注意力机制,实现无词汇开放场景分割,参数仅为SOTA的1/8,达成89.7语义相似度。
Danyang Li, Tianhao Wu, Bin Li 等
DriveSafe通过多模态场景描述结合LLM实现驾驶风险检测与安全建议,显著优于零-shot模型。
Sainithin Artham, Shankar Gangisetty, Avijit Dasgupta 等
EgoKit提供跨异构设备的统一低成本自我中心数据采集,支持六种设备。
Liuchuan Yu, Erdem Murat, Beichen Wang 等
EVA01通过Mixture-of-Transformers实现3D网格的原生理解与生成。
Zongyuan Yang, Mingjing Yi, Wanli Ma 等
VAGS通过 velocity 方向一致性动态调节 CFG,有效提升图像编辑与生成的结构保真度。
Yan Luo, Ahmadou Aidara, Jingyi Lu 等
DriveCtrl通过深度条件生成技术缩小模拟与真实驾驶视频的差距。
Haonan Zhao, Yiting Wang, Jingkun Chen 等
TAB-VLM评测600题、1600件印度文物,最佳GPT-5.2仅58.7%。
Mukul Ranjan, Prince Jha, Khushboo Kumari 等
提出非线性双极补偿方法,提升低比特量化模型的准确性,平均提高4.6%。
Peilin Sun, Jianxin Wu
提出自适应交错推理框架,结合层级数据管线,显著提升多模态生成的准确性与效率。
Qingyang Liu, Bingjie Gao, Canmiao Fu 等
提出EponaV2,通过未来深度与语义预测实现自主驾驶高质量规划,超越传统感知依赖模型。
Jiawei Xu, Zhizhou Zhong, Zhijian Shu 等
TOPOS框架通过TOPOS-VAE和TOPOS-DiT实现高保真3D头部生成,性能优于现有方法。
Bojun Xiong, Zoubin Bi, Xinghui Peng 等
CreFlow通过组合线性时序逻辑约束,结合局部修正和奖励引导,提升稀疏奖励下的机器人操控视频生成效果,成功率提升23.8%。
Zhenyang Ni, Yijiang Li, Ruochen Jiao 等
提出SIAA灰盒攻击,利用预训练ViT特征空间成功误导深度伪造检测器,成功率接近白盒。
Chiara Musso, Joy Battocchio, Andrea Montibeller 等