Context-Aware Explanations for Spatialized Document Layouts
CAPE用GPT-4o生成空间化文档布局的上下文解释,覆盖新闻与学术布局。
Wei Liu, John Wenskovitch, Chris North 等
CAPE用GPT-4o生成空间化文档布局的上下文解释,覆盖新闻与学术布局。
Wei Liu, John Wenskovitch, Chris North 等
MultiHashFormer采用多哈希签名机制支持因果语言模型,参数规模在100M至3B,显著优于标准Transformer,且支持无参数扩展多语言词汇。
Huiyin Xue, Atsuki Yamaguchi, Nikolaos Aletras
提出并实现了并行展开近似法(PRA),在ImageNet-1K上实现了1.94的FID。
Jiayi Xu, Di He, Guolin Ke
VASAE通过引入词汇对齐锚定,训练可命名的稀疏自编码器,保持重建质量的同时实现特征与词汇的几何对齐。
Kairui Zhang, Ziwen Yu, Zahraa S. Abdallah 等
提出SD-GPS框架,结合QwenVL3-2B实现自动形式化与引理提议,显著提升几何问题解答准确率。
Can Li, Ting Zhang, Junbo Zhao 等
LocalNav通过蒸馏前沿VLM和强化学习,实现嵌入式设备上的目标导航,推理延迟减少82.8%。
Nicolas Baumann, Liam Boyle, Pu Deng 等
提出了一种名为CSD的内容感知推测解码算法,在MS-COCO上加速图像生成4.33倍。
Mingcheng Wang, Junbo Qiao, Yunchen Li 等
Video-MME-Logical基准测试揭示了MLLMs在视频时序逻辑推理上的显著差距。
Hohin Kwan, Hongyu Li, Ray Zhang 等
ATOD结合退火调度与Turn级不确定性加权,有效提升多轮交互任务性能。
Qitai Tan, Zefang Zong, Mo Li 等
NormGuard通过奖励保持的范数约束,有效抑制RL后训练中的速度范数膨胀,改善图像质量。
Tianlin Pan, Lianyu Pang, Cheng Da 等
PerturbCellRL用四类生物学验证器强化scDFM,在1600步训练中提升单细胞一致性且保持群体预测竞争力。
Dongxia Wu, Mingyu Li, Yuhui Zhang 等
引入Masked Language Flow Models,结合掩码与流模型,提升多步推理能力。
Iskander Azangulov, Kianoosh Ashouritaklimi, Leo Zhang 等
提出Ko-WideSearch,基于自动合成验证的韩语宽度搜索基准,涵盖228个表格,评估Web代理的全集枚举能力。
Minbyul Jeong
RAC通过延迟奖励校正,显著减少策略偏差,提升RLHF效率。
Arnav Raj
VulcanVoxel通过3D占用场重建刀片插入的空间可行性,提升到达率至0.89。
Tianyu Li, Harpreet Sawhney, Minju Jung 等
证明共享嵌入架构中指令与数据不可完全分离,导致Prompt注入攻击无法完全防御。
Dewank Pant, Shruti Lohani, Avijit Kumar
DMV-Bench通过视觉记忆测试多模态智能体,DualMem方法在长链任务中表现优异。
Yujin Tang, Chenming Shang, Ruize Xu 等
QueenBee Planner通过自我演化通信拓扑结构提升多智能体系统的效率,显著降低RMSE和通信成本。
Congjia Tian, Yuhang Yao, Jiaming Cui
PolyFlow通过连续拓扑嵌入流匹配实现艺术风格网格生成,超越现有技术。
Chunshi Wang, Haohan Weng, Junliang Ye 等
RiVER框架利用无Ground-Truth的连续评分优化,提升LLMs在算法竞赛中的表现,平均提升2.4%-3.5%。
Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang 等