WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment
WebOperator利用树搜索实现Web环境中的行动感知与安全回溯,成功率达54.6%。
Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali 等
WebOperator利用树搜索实现Web环境中的行动感知与安全回溯,成功率达54.6%。
Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali 等
提出AdaptiveDetector,结合YOLOv11和VLM,动态调整检测阈值提升零样本多肽检测召回率。
Shengkai Xu, Hsiang Lun Kao, Tianxiang Xu 等
WeDetect通过检索实现快速开放词汇目标检测,在15个基准上达到SOTA性能,推理效率极高。
Shenghao Fu, Yukun Su, Fengyun Rao 等
提出轻量级视频片段选择方法,利用大模型提取关键时刻,达成接近参考片段的多模态长视频总结。
Galann Pennec, Zhengyuan Liu, Nicholas Asher 等
UFVideo实现多尺度多粒度视频理解,融合全局、像素和时间信息,显著优于GPT-4。
Hewen Pan, Cong Wei, Dashuang Liang 等
提出Group Diffusion,通过跨样本注意力提升图像生成质量,FID最高改善32.2%。
Sicheng Mo, Thao Nguyen, Richard Zhang 等
提出SEPL方法,通过特征探测和预测集成提高噪声域泛化性能。
Wang Lu, Jindong Wang
FACTS排行榜评估大语言模型的事实准确性,使用四个子排行榜,平均得分为68.8。
Aileen Cheng, Alon Jacovi, Amir Globerson 等
ReMe通过多层次蒸馏、场景索引和自我优化提升LLM代理记忆,超越模型规模。
Zouying Cao, Jiaji Deng, Li Yu 等
提出基于核展开的资源高效神经代理模型KHRONOS,用于多保真气动场预测,显著减少参数和计算成本。
Apurba Sarker, Reza T. Batley, Darshan Sarojini 等
SEMDICE为离策略状态熵最大化算法,基于平稳分布校正,能从任意离策略数据中学习最优SEM策略。
Jongmin Lee, Meiqi Sun, Pieter Abbeel
UniUGP框架提升自动驾驶在长尾场景中的理解、生成和规划能力,显著提高决策准确性。
Hao Lu, Ziyang Liu, Guangfeng Jiang 等
引入符合预测的带臂算法,结合统计保证与奖励效率,应对弱臂可分性。
Simone Cuonzo, Nina Deliu
通过细调极窄数据集引发大范围误导和隐性后门,揭示LLMs的泛化风险。
Jan Betley, Jorio Cocola, Dylan Feng 等
d-TreeRPO通过树结构优化提升扩散语言模型的策略优化可靠性,Sudoku任务提高86.2%。
Leyi Pan, Shuchang Tao, Yunpeng Zhai 等
基于YOLO、TensorRT与Isaac ROS VIO的QuadPlane着陆框架,实测单帧32.7 ms、30 FPS以上。
Ashik E Rasul, Humaira Tasnim, Ji Yu Kim 等
提出METRO算法,通过激活专家数而非处理Token数实现Memory-bound MoE的负载均衡,显著降低延迟。
Yanpeng Yu, Haiyue Ma, Krish Agarwal 等
Tri-Bench基准测试VLM在倾斜相机和物体干扰下的空间推理能力,平均准确率约69%。
Amit Bendkhale
InfiniteVL结合线性和稀疏注意力,实现高效无限输入视觉语言模型,解码速度提升1.7倍。
Hongyuan Tao, Bencheng Liao, Shaoyu Chen 等
提出AEGIS架构,结合控制屏障函数实现VLA模型的安全控制,提升障碍规避50%以上。
Songqiao Hu, Zeyi Liu, Shuang Liu 等