HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models
HSAP结合层次化序列感知算法,有效支持超长混合上下文序列的生成模型。
Songxin Zhang, Zejian Xie, Zhuoyang Song 等
HSAP结合层次化序列感知算法,有效支持超长混合上下文序列的生成模型。
Songxin Zhang, Zejian Xie, Zhuoyang Song 等
Arko-T为4B参数文本到结构化3D设计模型,能将自然语言直接映射为可编辑的CAD程序。
Liang Wang, Zhaoyang Xi, Zekai Xiang 等
HUMEMBR通过连续记忆与检索机制,模型化人类长周期行为,提升机器人长远推理能力。
Samira Huber, Klaas Pelzer, Duc M. Nguyen 等
RenderFormer++结合物理引导和层次化标记,提升全局光照渲染效率。
Huangsheng Du, Haoran Zhu, Youcheng Cai 等
FlowAWR以优势加权速度修正实现无SDE、无CFG训练,在SD3.5上1.2k步达PickScore 24.12。
Zheming Fu, Ruizhe He, Wei Shang 等
提出BrainJanus模型,融合脑、视觉和语言模态,通过离散Token实现多模态理解与生成。
Haitao Wu, Qirui Zhang, Zhouheng Yao 等
VisReflect通过潜在视觉反射提升长视觉上下文中的细粒度感知,图像基准提升4.1%,视频基准提升1.8%。
Xiaoqian Shen, Mohamed Elhoseiny
提出接受判定的KL散度界限,适用于贪婪、松弛和树状解码,增强实用性。
Aaryam Sharma
TACO通过DAPR和OGAR优化工具调用,提升视觉问答准确率。
Mingkuan Feng, Jinyang Wu, Hao Gu 等
提出Clarus,基于项目-代理-资源模型,实现跨阶段可追溯的科研协作基础设施。
Zihan Guo, Zeyi Chen, Zhiyu Chen 等
本研究通过Hessian特征分析优化器对训练动态的影响,发现SGD趋于稳定方向,Adam表现出Eigenvector重组与局部化。
Marcelina Marjankowska, Valerio Modugno, Paolo Barucca
提出Blind Gap和Visual Gain指标,揭示交通事故视频问答中的视觉依赖问题。
Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim 等
LatEnt Noise maSk (Lens)通过减少冗余视觉信息提升多模态大语言模型的推理能力,提升了VQA数据集2.4-6.4分。
Kai Jiang, Ruishu Zhu, Siqi Huang 等
提出STE和SPID框架,量化语义信息流动,揭示对话中信息动态。
Leonardo S. Goodall, Andrea I. Luppi, Pedro A. M. Mediano
InnerZoom通过单次前向传递实现高效准确的GUI定位,显著提升了基准测试成绩。
Chen Liu, Ling Chen, Hanzhang Zhou 等
VISTA通过无训练、模型无关的层面实现对大规模语言模型的自我管理上下文,提升任务表现。
Binyan Xu, Haitao Li, Kehuan Zhang
提出非凸参数集下的最优后验E值,应用于投票系统的序贯检验。
Adrienne Tuynman, Timothée Mathieu
FWS以6个VQA数据集构建FaithfulQA,60K监督使VLM的RL更准、更稳、更忠实。
Peng, Lee, Yin Zhang 等
IHDec利用JSD检测角色偏离,动态调节对比解码以强化多轮指令层级。
Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun 等
提出层次化导航框架,结合跨图记忆与视点规划,提升无人机目标定位性能。
Junjie Gao, Yuqi Chen, Yongzhou Pan 等