Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms
本文比较分析了功能调用与模型上下文协议在LLM代理中的安全漏洞,发现架构影响攻击成功率。
Tarek Gasmi, Ramzi Guesmi, Ines Belhadj 等
本文比较分析了功能调用与模型上下文协议在LLM代理中的安全漏洞,发现架构影响攻击成功率。
Tarek Gasmi, Ramzi Guesmi, Ines Belhadj 等
Tora2通过解耦个性化提取和门控自注意实现多实体视频的外观与运动定制,显著提升细节保留和多模态对齐。
Zhenghao Zhang, Junchao Liao, Xiangyu Meng 等
GTA1通过测试时尺度调整和RL模型实现高精度GUI交互,显著优于SOTA。
Yan Yang, Dongxu Li, Yutong Dai 等
PaddleOCR 3.0引入PP-OCRv5、PP-StructureV3和PP-ChatOCRv4,提升多语种识别与文档理解能力。
Cheng Cui, Ting Sun, Manhui Lin 等
OpenWorldSAM扩展SAM2,结合多模态嵌入实现开放词汇图像分割,训练仅4.5M参数。
Shiting Xiao, Rishabh Kabra, Yuhang Li 等
通过扩展Diffusion Policy评估多任务机器人行为模型(LBMs),显示多任务预训练提升成功率和鲁棒性。
TRI LBM Team, Jose Barreiros, Andrew Beaulieu 等
Gemini 2.5 Pro结合长上下文、多模态和推理能力,达成SOTA性能。
Gheorghe Comanici, Eric Bieber, Mike Schaekermann 等
ABench-Physics通过高难度动态物理问题评估LLMs的物理推理能力,揭示显著性能差距。
Yiming Zhang, Yingfan Ma, Yanmei Gu 等
DreamVLA通过预测动态区域、深度和语义,建立感知-预测-行动闭环,提升机器人操控性能。
Wenyao Zhang, Hongsi Liu, Zekun Qi 等
引入J1-ENVS与J1-EVAL,评估中国法律场景中LLM代理的动态法律能力,表现不足60%。
Zheng Jia, Shengbin Yue, Wei Chen 等
提出MemOS,基于系统资源管理的记忆操作系统,显著提升LLMs的长时记忆与个性化能力。
Zhiyu Li, Chenyang Xi, Chunyu Li 等
EvoAgentX通过整合TextGrad、AFlow和MIPRO,实现多智能体工作流的自动生成与演化优化,提升性能。
Yingxu Wang, Siwei Liu, Jinyuan Fang 等
提出Conformal Information Pursuit(C-IP),利用预测集估计不确定性,优化大模型交互查询,提升问答效率。
Kwan Ho Ryan Chan, Yuyan Ge, Edgar Dobriban 等
Point3R通过显式空间指针记忆实现流式密集3D重建,性能优于或接近SOTA。
Yuqi Wu, Wenzhao Zheng, Jie Zhou 等
LiteReality通过场景理解与模型检索,将RGB-D扫描转化为紧凑逼真的3D场景,支持交互与渲染。
Zhening Huang, Xiaoyang Wu, Fangcheng Zhong 等
DeSTA2.5-Audio通过自生成跨模态对齐,提升大规模音频语言模型性能,涵盖500万样本,突破遗忘问题。
Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu 等
DexVLG模型使用单视角RGBD输入预测灵巧抓取姿势,成功率超过76%。
Jiawei He, Danshi Li, Xinqiang Yu 等
提出ACE方法,增强非高斯噪声下结构无关估计的鲁棒性,提升估计精度。
Jikai Jin, Lester Mackey, Vasilis Syrgkanis
Kwai Keye-VL为短视频理解设计的8亿参数多模态模型,结合大规模视频数据与创新训练策略。
Kwai Keye Team, Biao Yang, Bin Wen 等
通过筛选多样且难度适中的推理轨迹,从强教师模型蒸馏出高质量自然思考数据,显著提升模型推理能力。
Yang Li, Youssef Emad, Karthik Padthe 等