Holo-World: Unified Camera, Object and Weather Control for Video World Model
提出Holo-World模型,结合单帧图像实现摄像机、物体和天气的统一控制,利用HoloStateData数据集进行训练。
Xiangchen Yin, Wenzhang Sun, Jiahui Yuan 等
提出Holo-World模型,结合单帧图像实现摄像机、物体和天气的统一控制,利用HoloStateData数据集进行训练。
Xiangchen Yin, Wenzhang Sun, Jiahui Yuan 等
研究揭示视觉标记在大语言模型中的隐藏演变,比较了上下文注入和分层注入方法。
Wish Suharitdamrong, Tony Alex, Xiatian Zhu 等
MobileForge采用层级反馈引导策略优化,无需标注即可适应移动GUI,达成67.2% Pass@3。
Guangyi Liu, Pengxiang Zhao, Gao Wu 等
CARE通过能力感知奖励调整优化视频多模态推理长度,提升推理准确性和效率。
Chengwen Liu, Hao Peng, Jisheng Dang 等
提出多智能体交易记忆(MATM)框架,通过共享轨迹提升异构智能体群体的任务表现,实验显示成功率提升8%,步骤减少0.59。
To Eun Kim, Xuhong He, Dishank Jain 等
提出基于机器学习的查询感知路由框架,有效平衡过滤近似最近邻搜索的召回率与QPS,训练模型在六个真实数据集上表现优异。
Qianqian Xiong, Mengxuan Zhang
提出基于分段多项式插值的梯度下降(PPI-GD),在数据维度d为对数多项式阶时实现优越的oracle复杂度。
Dongmin Lee, William Lu, Anuran Makur
提出控制窗口法,基于单神经元线性投影预测行为控制阈值,验证在15个神经元上的准确性。
Hongliang Liu
引入交接有效性概念,分析82个基于LLM的EDA系统的边界分类与通信协议。
Jiawei Liu, Peiyi Han, Yuntao Lu 等
Occ-VLM利用单一2D编码器实现室内场景的3D理解,达到最先进的多视图占用预测性能。
Jianing Li, Zhou Fang, Yijiang Liu 等
通过修改国籍和语言参数生成多语言心理健康对话数据集,发现临床一致性问题。
Yunkai Xu, Saeed Abdullah
ImageWAM通过图像编辑替代视频生成,提升机器人动作预测效率,减少FLOPs至1/6。
Yuyang Zhang, Wenyao Zhang, Zekun Qi 等
VeriBound用PAC-Bayes理论解释FOVER跨任务泛化,验证准确率达78.6%。
Amirul Rahman, Mohammed Sabih Alsharari
提出基于图灵奖励的强化学习方法Turing-RL,用于训练人类用户模拟器,显著优于传统匹配方法。
Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu 等
提出DO AS I DO算法,从单目RGB视频重建并迁移人类手部操作数据,用于机器人多指操控,超越现有方法。
Bhawna Paliwal, Haritheja Etukuru, William Liang 等
Diffusion-Proof框架通过dLLMs实现形式定理证明,比AR模型提高6.14%。
Ruida Wang, Rui Pan, Pengcheng Wang 等
提出锚定特征参数化的可观测性与一致性分析,实验显示其提升VINS的估计一致性。
Mitchell Cohen, Vassili Korotkine, James Richard Forbes
本研究通过比较网页撤回、自我更正和专家纠错三种策略,发现自我更正能在不损害可信度的前提下有效修正错误,且社会连接增强修正效果。
Biswadeep Sen, Yi-Chieh Lee
提出STARE(Surprisal-guided Token-level Advantage Reweighting),通过比率调节确保策略熵稳定,在1.5B到32B模型上提升准确率4%-8%。
Haipeng Luo, Qingfeng Sun, Songli Wu 等
通过范畴结构从论文知识图谱中挖掘可证伪的研究想法,过滤比率约17:1。
Yuchen Wang, Zhongzhi Luan