VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
VISOR方法通过稀疏选择视觉语言交互,提升大规模视觉语言模型效率,减少推理成本。
Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas 等
VISOR方法通过稀疏选择视觉语言交互,提升大规模视觉语言模型效率,减少推理成本。
Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas 等
AgentRVOS通过SAM3和MLLM结合,实现零样本视频对象分割,性能领先。
Woojeong Jin, Jaeho Lee, Heeseong Shin 等
CSTS通过实体关系抽象提高跨环境AI检测的稳定性,解决了模式扰动下的崩溃问题。
Abdul Rahman
c-CRAB数据集评估代码审查代理的能力,现有代理仅解决40%的任务。
Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf 等
3DCity-LLM通过粗到细特征编码策略提升3D城市级感知与理解,数据集达1.2M样本。
Yiping Chen, Jinpeng Li, Wenyu Ke 等
研究表明,LLM在软件演化下的测试生成表现不佳,尤其在语义改变时,测试通过率降至66%。
Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar
提出D2TC方法,成功规避IoT网络中的入侵检测系统,提升攻击成功率。
Islam Debicha, Tayeb Kenaza, Ishak Charfi 等
SortedRL通过在线长度感知调度加速大语言模型的强化学习训练,提升效率并提高性能。
Yiqi Zhang, Huiqiang Jiang, Xufang Luo 等
提出Graph Energy Matching (GEM),在分子图生成中超越离散扩散模型。
Michal Balcerak, Suprosana Shit, Chinmay Prabhakar 等
ABot-PhysWorld:基于扩散变换器的物理对齐机器人操控世界模型,利用三百万操控片段实现物理合理的视频生成。
Yuzhi Chen, Ronghan Chen, Dongjie Huo 等
提出LLM奥林匹克评估,解决模型评估中的透明性和信任问题。
Jan Christian Blaise Cruz, Alham Fikri Aji
提出SIDReasoner,通过增强SID与语言对齐提升生成推荐中的推理能力,显著改善多数据集表现。
Yingzhi He, Yan Sun, Junfei Tan 等
提出DAK-UCB,结合多样性与保真性实现生成模型在线选择。
Donya Jafari, Farzan Farnia
PCR系统通过智能预取和流水线技术提升KV缓存重用,显著降低RAG服务延迟。
Wenfeng Wang, Xiaofeng Hou, Peng Tang 等
本研究通过分析多GPU大模型推理中的CPU瓶颈,发现CPU资源不足导致GPU利用率低,延迟显著增加。
Euijun Chung, Yuxiao Jia, Aaron Jezghani 等
提出PRISM框架,通过重要采样学习 humanoid 机器人安全停止监控器,提升数据效率和可靠性。
Yifan Sun, Yiyuan Pan, Shangtao Li 等
提出TrajLoom框架,结合Grid-Anchor Offset编码、VAE与Flow匹配,预测81帧未来轨迹,提升稳定性与逼真度。
Zewei Zhang, Jia Jun Cheng Xian, Kaiwen Liu 等
CAPITU利用巴西文学经典文本,设计59个可自动验证的指令类型,评估大模型在葡萄牙语中的指令遵循能力。
Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau 等
VideoDetective通过结合外部查询和内部相关性,实现长视频理解,提升了VideoMME-long准确率7.5%。
Ruoliu Yang, Chu Wu, Caifeng Shan 等
UNITE通过统一的自编码器实现令牌化和潜在扩散,ImageNet上FID达到2.12。
Shivam Duggal, Xingjian Bai, Zongze Wu 等