OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents
OS-SPEAR工具包系统分析OS代理的安全性、性能、效率和鲁棒性,揭示效率与安全的权衡。
Zheng Wu, Yi Hua, Zhaoyuan Huang 等
OS-SPEAR工具包系统分析OS代理的安全性、性能、效率和鲁棒性,揭示效率与安全的权衡。
Zheng Wu, Yi Hua, Zhaoyuan Huang 等
通过表示稳定性提高表格检索的鲁棒性,使用中心化平均法减少格式特异性偏差。
Kushal Raj Bhandari, Adarsh Singh, Jianxi Gao 等
提出SSL结构化技能表示,分离调度、场景和逻辑层,提升技能检索和风险评估性能。
Qiliang Liang, Hansi Wang, Zhong Liang 等
DeepSeek-V4采用混合注意力和mHC,支持百万令牌长序列,显著提升长文本处理效率。
DeepSeek-AI, Anyi Xu, Bangcai Lin 等
AutoPyVerifier通过DAG搜索自动学习紧凑的Python验证器集,提升目标任务F1达55点。
Pouya Pezeshkpour, Estevam Hruschka
研究揭示LLM在生成叙述时对全球多数民族的代表性伤害,使用QA模型分析500,000个故事。
Ilana Nguyen, Harini Suresh, Thema Monroe-White 等
通过扩展模型规模(4B参数、1万亿tokens)实现点时语言模型,性能接近非限制模型,解决未来信息泄露问题。
Bryan Kelly, Semyon Malamud, Johannes Schwab 等
CRAFT方法通过聚类回归自适应筛选训练数据,在英印翻译中提升BLEU值2.13分。
Parthasarathi Panda, Asheswari Swain, Subhrakanta Panda
BERAG通过贝叶斯集成改进检索增强生成,显著提升知识型视觉问答性能。
Jinghong Chen, Jingbiao Mei, Guangyu Yang 等
MuDABench通过多代理工作流实现跨文档分析问答,显著提升准确率。
Zhanli Li, Yixuan Cao, Lvzhou Luo 等
基于GPT-4o、Gemini与DeepSeek的多语YouTube话语分析显示,文化型健康误导难靠提示词识别。
Anamta Khan, Ratna Kandala, Deepti 等
EVENT5Ws:一个用于文档开放域事件抽取的大型数据集,提供手动注释和统计验证。
Praval Sharma, Ashok Samal, Leen-Kiat Soh 等
VLAA-GUI框架结合完备性验证、循环打破和在线搜索,显著提升GUI自动化性能。
Qijun Han, Haoqin Tu, Zijun Wang 等
提出ProactAgent框架,通过EXPONEVO和PROACTRL实现主动记忆检索,在SciWorld上成功率提升32%,交互轮数减少33%。
Yuxuan Cai, Wei Li, Jie Zhou 等
SCG-MEM通过认知图式约束生成,显著提升LoCoMo基准测试表现。
Lei Zheng, Weinan Song, Daili Li 等
SkillLearnBench评估连续学习生成技能的三层指标,结果显示方法提升有限。
Shanshan Zhong, Yi Lu, Jingjie Ning 等
引入Memora基准与FAMA指标,评估长时记忆在个性化代理中的表现,揭示模型在记忆整合与遗忘处理中的不足。
Md Nayem Uddin, Kumar Shubham, Eduardo Blanco 等
通过自然语言和符号视图对齐,发现LLM的共享逻辑子空间,提高逻辑推理准确率达11%。
Feihao Fang, My T. Thai, Yuanyuan Lei
InsightGen生成多样且相关的见解,提升开放式文档问答体验。
Saransh Sharma, Pritika Ramu, Aparna Garimella 等
通过GPT模型预测开放式调查文本的体验评分,提示优化提升2个百分点。
Andrew Hong, Jason Potteiger, Luis E. Zapata