Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability
提出统一架构-生命周期框架,提升CUA在实际环境中的可靠性,分析感知、决策、执行层级及创建、部署、运行、维护阶段。
Zejian Chen, Zhanyuan Liu, Chaozhuo Li 等
提出统一架构-生命周期框架,提升CUA在实际环境中的可靠性,分析感知、决策、执行层级及创建、部署、运行、维护阶段。
Zejian Chen, Zhanyuan Liu, Chaozhuo Li 等
提出Residual Latent Action (RLA)方法,通过DINO残差学习世界模型,在多任务机器人操作中提升预测精度并减少计算开销。
Xinyu Zhang, Zhengtong Xu, Yutian Tao 等
ModelLens通过学习模型-数据集-指标的隐空间,能在未运行目标数据集的情况下推荐最佳模型。
Rui Cai, Weijie Jacky Mo, Xiaofei Wen 等
行为提示推理通过监督提高了效率和安全性,成功率从46%提升至96%。
Christopher Z. Cui, Taylor W. Killian, Prithviraj Ammanabrolu
提出STABLE框架,通过强化学习实现无需回滚的稳定积木结构生成,推理速度提升94%。
Chenhui Xu, Ziyue Bai, Fuxun Yu 等
提出PostEDA-Bench,包含145个任务,评估LLM在DRC修复与PPA优化中的表现。
Pengju Liu, Nuo Xu, Jinwei Tang 等
SAFE挑战利用深度学习检测多源高质量合成视频,取得跨生成器泛化显著进展。
Kirill Trapeznikov, Gabriel Mancino-Ball, Jonathan Li 等
提出MIND指标,基于切片Wasserstein,样本效率高、计算快、抗攻击。
Quentin Berthet, Yu-Han Wu, Clement Crepy 等
ROSE利用合作弹性在服务GPU上进行Agentic RL,提升1.3-3.3倍吞吐量。
Wei Gao, Yuheng Zhao, Dilxat Muhtar 等
提出“绑定约束论”,强调长远任务中调度器(harness)配置对性能影响大于模型,建议披露调度器信息。
Yunbei Zhang, Janet Wang, Yingqiang Ge 等
HumanNet视频集通过Qwen模型实现人类视频与机器人数据的替代,提升学习效率。
Yufan Deng, Daquan Zhou
AOPD通过在非正优势区域引入局部分歧最小化,改善标准OPD的高方差和探索瓶颈,提升数学推理性能。
Nan Jia, Haojin Yang, Xing Ma 等
提出桥接接口理论,区分预测、压缩与赋能,验证完美预测需识别潜在商与控制能力。
Richard Csaky
InciteResearch框架将隐性理解转化为明确研究提案,提升新颖性和影响力。
Jie Yu, Song Qiu
提出面向低资源口语方言的线性语义分割模型,显著优于基线,构建多语种标注数据。
Kirill Chirkunov, Younes Samih, Abed Alhakim Freihat 等
提出自适应坐标变换(ACT)模块,提升神经算子在动态结构追踪中的表现。
Chaoyu Liu, Zhonghao Li, Gaohang Chen 等
Prologue通过生成专用引导令牌,缩小重建与生成差距,提升ImageNet 256×256的gFID从21.01降至10.75。
Bowen Zheng, Weijian Luo, Guang Yang 等
提出TEBench,基于项目级别的测试演化基准,涵盖三类变化类型,识别准确率45.7%-49.4%。
Ye Shang, Quanjun Zhang, Haichuan Hu 等
SPEED方法通过浅层预填充和深层解码减少长上下文推理成本,提升效率。
Jungsuk Oh, Hyeseo Jeon, Hyunjune Ji 等
VibeServe利用多智能体循环自动生成定制化LLM服务系统,性能媲美或优于手工优化方案。
Keisuke Kamahori, Shihang Li, Simon Peter 等