Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning
提出Video-in-the-Loop(ViTL)框架,通过两阶段定位与回答实现长视频问答,提升效率与解释性。
Chendong Wang, Donglin Bai, Yifan Yang 等
提出Video-in-the-Loop(ViTL)框架,通过两阶段定位与回答实现长视频问答,提升效率与解释性。
Chendong Wang, Donglin Bai, Yifan Yang 等
OptAgent以多智能体模拟和遗传算法优化电商查询,整体得分提升21.98%,较BoN高3.36%。
Divij Handa, David Blincoe, Orson Adams 等
提出HVGC框架和BridgeDiT模型,实现文本到声音视频生成,性能优于现有方法。
Kaisi Guan, Xihua Wang, Zhengfeng Lai 等
基于限制高斯oracle的均匀采样算法,复杂度为O(d² log(1/ε))。
Thanh Dang, Jiaming Liang
TokenFlow通过预占调度和主动KV缓存管理提升LLM文本流响应性能,达82.5%吞吐提升。
Junyi Chen, Chuheng Du, Renyuan Liu 等
FSFSplatter在2分钟内通过稀疏视图实现高精度表面重建,减少28.39%误差。
Yibin Zhao, Yihan Pan, Jun Nan 等
提出基于双层优化的隐蔽攻击模型,结合物理仿真与MPC控制,分析燃气管网的网络安全风险。
Tejaswini Sanjay Katale, Lu Gao, Yunpeng Zhang 等
提出平衡匹配(EqM)框架,通过学习隐式能量景观的平衡梯度,实现高质量生成,FID达1.90。
Runqian Wang, Yilun Du
Self-Forcing++通过样本采样和分布匹配,成功将长视频生成时间扩展至4分钟,超越原模型20倍,显著提升质量与一致性。
Justin Cui, Jie Wu, Ming Li 等
Diffusion^2利用3D点云生成RF热图,误差仅1.9 dB,速度提升27倍。
Kyoungjun Park, Yifan Yang, Changhan Ge 等
本研究探索Transformer在无图结构偏置下,直接用笛卡尔坐标预测分子能量与力,达成与GNN相当的精度。
Tobias Kreiman, Yutong Bai, Fadi Atieh 等
引入Ground-Truth Alignment评估框架,诊断VLM移动代理的推理-执行差距。
Lingzhong Dong, Ziqi Zhou, Shuaibo Yang 等
使用动态平均场理论分析对角线性网络的梯度流动,揭示初始化对解的影响。
Sota Nishiyama, Masaaki Imaizumi
提出R-AIRL通过逆强化学习从专家示范中学习推理奖励,提升模型推理能力。
Claudio Fanconi, Nicolás Astorga, Mihaela van der Schaar
采用统一预训练协议,验证合成数据在LLM中的缩放规律、优势与风险,发现混合使用可提升训练效率。
Feiyang Kang, Newsha Ardalani, Michael Kuchnik 等
提出基于创新表示的时间序列生成预训练变换模型(TS-GPT),用于工程监控与控制。
Lang Tong, Xinyi Wang
研究探讨在噪声反馈下偏好优化的泛化能力,提出GPO方法并验证其有效性。
Shawn Im, Sharon Li
MAHALO框架通过PRM指导解码实现多目标对齐,提升数学推理和人类价值观等领域表现。
Yiran Shen, Yu Xia, Jonathan Chang 等
ModernVBERT是一款250M参数的视觉-语言编码器,通过改进注意力掩码和训练策略,显著提升文档检索性能。
Paul Teiletche, Quentin Macé, Max Conti 等
本研究提出多轮强化学习(RL)训练大规模语言模型(LLM)代理的系统框架,强调环境、奖励和策略三大支柱,实证验证在TextWorld、ALFWorld和SWE-Gym中的有效性。
Ruiyi Wang, Prithviraj Ammanabrolu