Logics-Parsing-Omni Technical Report
Omni Parsing框架通过统一分类法和逐步解析范式,实现多模态数据的标准化解析。
Xin An, Jingyi Cai, Xiangyang Chen 等
Omni Parsing框架通过统一分类法和逐步解析范式,实现多模态数据的标准化解析。
Xin An, Jingyi Cai, Xiangyang Chen 等
提出了一种变分潜在平衡(VLE)方法,以生物学上合理的方式近似BPTT,提升了复杂时空模式学习的生物可行性。
Simon Brandt, Paul Haider, Walter Senn 等
提出StateFactory,通过层次化对象-属性结构实现跨域奖励预测,零-shot EPIC距离降低60%。
Yijun Shen, Delong Chen, Xianming Hu 等
OddGridBench揭示MLLMs在视觉差异检测上的不足,提出OddGrid-GRPO提升性能。
Tengjin Weng, Wenhao Jiang, Jingyi Wang 等
RoomTour3D-IGR用隐式几何利用网页视频,跨四项VLN基准提升超6%。
Mingfei Han, Haihong Hao, Liang Ma 等
TTC层通过LQR规划提升LLM推理性能,MATH-500提升27.8%。
Peihao Wang, Shan Yang, Xijun Wang 等
ZeroWBC利用人类自我视角视频,结合视觉-语言模型生成全身动作,实现无需遥控的 humanoid 交互。
Haoran Yang, Jiacheng Bao, Yucheng Xin 等
WS-Net通过状态空间和弱信号注意力融合解决弱信号崩溃问题,实现RMSE和SAD分别减少55%和63%。
Zekun Long, Ali Zia, Guanyiman Fu 等
MEMO通过记忆增强模型上下文优化,提升多轮多智能体LLM游戏的胜率从25.1%到49.5%,显著降低方差。
Yunfei Xie, Kevin Wang, Bobby Cheng 等
利用对偶性优化参数子模函数极小化,时间复杂度达O(n² log(nM∥d∥₁)+n³ log(nM∥d∥₁)+SFM)
Swati Gupta, Alec Zhu
SecAgent通过语义上下文机制和中文数据集提升移动GUI代理效率,性能媲美7B-8B模型。
Yiping Xie, Song Chen, Jingxuan Xing 等
提出结合自适应循环和记忆库的Transformer模型,在数学推理任务中性能提升22%,常识任务恢复性能。
Markus Frey, Behzad Shomali, Ali Hamza Bashir 等
提出HDR-NSFF,通过4D时空建模实现动态HDR场景的高质量重建,显著优于2D融合方法。
Shin Dong-Yeon, Kim Jun-Seong, Kwon Byung-Ki 等
MM-TS方法通过动态温度和边距调度提升长尾数据的对比学习性能。
Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele 等
Ramsa语料库提供阿联酋阿拉伯语的ASR和TTS基线,Whisper-large-v3-turbo表现最佳。
Rania Al-Sabbagh
QualiTeacher通过质量条件伪标签提升图像修复效果,显著提高模型泛化能力。
Fengyang Xiao, Jingjia Feng, Peng Hu 等
提出HILA框架,结合双环策略优化,实现多智能体LLMs的自适应人机合作,显著优于现有方法。
Wei Yang, Defu Cao, Jiacheng Pang 等
提出DMRAL框架,结合关系图和子问引导,提升大规模多表数值问答性能。
Feng Luo, Hai Lan, Hui Luo 等
提出基于Kinematic Attention Aggregation的Masked Motion Diffusion Model(MMDM),实现运动数据的高效补全与重建。
Junkun Jiang, Jie Chen, Ho Yin Au 等
UniUncer通过动态静态不确定性框架提升驾驶准确性,减少7%轨迹误差。
Yu Gao, Jijun Wang, Zongzheng Zhang 等