SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy
SpatialVAM通过3D视频扩散模型实现高效机器人策略学习,在Meta-World等任务中提升22%。
Peiyan Li, Yixiang Chen, Yuan Xu 等
SpatialVAM通过3D视频扩散模型实现高效机器人策略学习,在Meta-World等任务中提升22%。
Peiyan Li, Yixiang Chen, Yuan Xu 等
ARM通过三态标签实现长时序机器人操控中的相对优势估计,成功提升折叠毛巾任务的成功率至99.4%。
Yiming Mao, Zixi Yu, Weixin Mao 等
InfoSeeker以Host–Manager–Worker层级并行架构,在WideSearch达8.38%成功率并提速3–5倍。
Ka Yiu Lee, Yuxuan Huang, Zhiyuan He 等
提出RTT框架,将响应级评分与Token级奖励结合,利用Token相关判别器实现细粒度奖励,显著提升指令跟随性能。
Tianze Xu, Yanzhao Zheng, Pengrui Lu 等
PolyBench基于Polymarket,结合38,666个二元预测市场、订单簿和新闻流,评估7个大型语言模型的预测和交易能力,只有两款模型实现正收益。
Pu Cheng, Juncheng Liu, Yunshen Long
通过限制简单词汇(如“非常”、“只是”)改善LLM推理效果,优于深层语法约束(如E-Prime),验证了输出正则化机制。
Rodney Jehu-Appiah
通过角色扮演LLM训练,LLMimic显著提升AI素养,降低AI劝说成功率,改善社会责任感。
Qihui Fan, Min Ge, Chenyan Jia 等
VERTIGO通过视觉偏好优化,减少角色离屏率至0%,提升镜头质量。
Mengtian Li, Yuwei Lu, Feifei Li 等
多代理视频推荐系统结合LLM,提升推荐精度和解释性。
Srivaths Ranganathan, Abhishek Dharmaratnakar, Anushree Sinha 等
采用社会媒体模拟,分析LLMs对残障群体的偏见,发现过度理想化与偏见强化。
Marco Bombieri, Simone Paolo Ponzetto, Marco Rospocher
RebusBench评估LVLMs的认知视觉推理,性能低于10%精确匹配。
Seyed Amir Kasaei, Arash Marioriyad, Mahbod Khaleti 等
提出SteerFlow,通过固定点求解与轨迹插值实现高保真逆向图像编辑,提升源图保持性。
Thinh Dao, Zhen Wang, Kien T. Pham 等
提出统一框架分析多种记忆方法,设计新模型在长对话任务中超越SOTA。
Yanchen Wu, Tenghui Lin, Yingli Zhou 等
ReFlow通过自我校正机制实现单目动态场景的高质量4D重建,避免外部运动引导。
Yanzhe Liang, Ruijie Zhu, Hanzhi Chang 等
提出DBCooker,利用LLMs自动合成数据库原生函数,准确率提升34.55%。
Wei Zhou, Xuanhe Zhou, Qikang He 等
提出“魔、狂、天、罪”框架,模型输出多样性依任务目标而定,分析四类场景。
Harnoor Dhingra
引入FoodGuardBench评估LLMs食品安全性,揭示三大漏洞。
Weidi Luo, Xiaofei Wen, Tenghao Huang 等
通过测试时计算提升潜在泛化,使用强化学习训练长思维链。
Arslan Chaudhry, Sridhar Thiagarajan, Andrew Lampinen
研究展示了GRU-based RSSM在对抗性攻击下的安全风险,奖励减少59.5%。
Manoj Parmar
HippoCamp基准测试评估多模态文件管理代理,揭示当前模型在用户环境中的局限性,最高准确率仅48.3%。
Zhe Yang, Shulin Tian, Kairui Hu 等