ZeroVO: Visual Odometry with Minimal Assumptions
ZeroVO算法在多种环境下实现零样本泛化,提升30%以上。
Lei Lai, Zekai Yin, Eshed Ohn-Bar
ZeroVO算法在多种环境下实现零样本泛化,提升30%以上。
Lei Lai, Zekai Yin, Eshed Ohn-Bar
Fast ECoT通过缓存与并行化显著降低ECoT推理延迟,提升效率达7.5倍。
Zhekai Duan, Yuan Zhang, Shikai Geng 等
SongBloom结合自回归草图和扩散精炼,生成高质量歌曲,超越现有方法。
Chenyu Yang, Shuai Wang, Hangting Chen 等
ATRADA框架通过潜在空间数据增强生成高质量飞行轨迹数据。
Seokbin Yoon, Keumjin Lee
LeVo框架通过多偏好对齐方法显著提升歌曲生成质量。
Shun Lei, Yaoxun Xu, Zhiwei Lin 等
SpatialLM结合点云与大模型,提出结构化室内场景理解,达布局估算和3D检测新高。
Yongsen Mao, Junhao Zhong, Chuan Fang 等
本文分析40种LLM不确定性量化方法,指出评估偏离真实场景,强调以人为本改进方向。
Siddartha Devic, Tejas Srinivasan, Jesse Thomason 等
基于Mistral-7B的指令式文本嵌入框架,结合软监督与硬负样本挖掘,提升多任务表现。
Jooyoung Choi, Hyun Kim, Hansol Jang 等
ReCogDrive结合VLM和扩散规划器,实现端到端自主驾驶,提升安全性和稳定性。
Yongkang Li, Kaixin Xiong, Xiangyu Guo 等
提出音频感知解码(AAD),提升LALMs在对象幻觉数据集上的F1分数0.046到0.428。
Tzu-wen Hsu, Ke-Han Lu, Cheng-Han Chiang 等
提出SamS算法,通过动态样本调度提升大模型偏好优化性能,性能提升达12%以上。
Zixuan Huang, Yikun Ban, Lean Fu 等
Lingshu:面向医学多模态理解的通用基础模型,融合丰富医学知识。
LASA Team, Weiwen Xu, Hou Pong Chan 等
提出GenMinds框架,结合认知科学支持结构化信念表示,评估依赖RECAP框架,推动从表面模仿向思维模拟转变。
Chance Jiajie Li, Jiayi Wu, Zhenze Mo 等
提出VLM4TS结合ViT4TS实现无训练TSAD,F1提升24.6%。
Zelin He, Sarah Alnegheimish, Matthew Reimherr
提出GTRS(泛化轨迹评分)框架,结合扩散模型和词汇泛化技术,提升端到端多模态自动驾驶轨迹评分性能。
Zhenxin Li, Wenhao Yao, Zi Wang 等
提出面向户外环境的 terrain-aware 任务驱动3D场景图生成方法,结合LiDAR和语义映射。
Chad R Samuelson, Timothy W McLain, Joshua G Mangelson
提出五维区分AI智能体与LLM聊天机器人,基于演化视角分析评估框架。
Jiachen Zhu, Menghui Zhu, Renting Rui 等
提出Cartridges,通过自我学习训练小型KV缓存,实现长文本上下文的高效表示,显著降低内存和计算成本。
Sabri Eyuboglu, Ryan Ehrlich, Simran Arora 等
提出LLM幻觉的统一理论框架,分析根源与检测方法,强调数学基础与未来方向。
Chaozhuo Li, Pengbo Wang, Chenxu Wang 等
提出EF-VFM,用指数族分布生成混合特征的表格数据,达到最优性能。
Andrés Guzmán-Cordero, Floor Eijkelboom, Jan-Willem van de Meent