MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

TL;DR

MyPCBench测试个人智能计算代理,Claude Opus 4.6解决55.4%任务。

cs.LG 🔴 高级 2026-06-15 4 次浏览
Lawrence Keunho Jang Andrew Keunwoo Jang Jing Yu Koh Ruslan Salakhutdinov
基准测试 个人助理 Linux桌面 Claude Opus 多应用

核心发现

方法论

MyPCBench在Linux桌面上模拟17个真实世界的Web应用程序,测试个人智能计算代理的性能。每个任务都基于真实请求,使用统一的计算机和bash工具界面进行评估。

关键结果

  • Claude Opus 4.6在184个任务中完全解决了55.4%,是唯一超过50%的模型。
  • 模型失败集中在跨越多个应用程序的任务和长轨迹上,个性化需求最大。
  • 在7个以上应用程序的任务中,Claude Opus 4.6的完美率下降到36%。

研究意义

MyPCBench填补了现有基准测试与实际部署之间的差距,特别是在需要个性化和登录信息的Web任务中。它为评估个人助理在用户完整数字生活中的表现提供了一个新的标准。

技术贡献

MyPCBench通过在完整的Linux桌面环境中引入一致的用户身份和跨应用历史,提供了一个可重复的评估平台。这种方法允许对个性化代理进行更真实的测试。

新颖性

这是第一个在完整个人计算机规模上种植连贯用户身份的基准测试,填补了现有评估方法的空白。

局限性

  • 模型在跨越多个应用程序的任务中表现不佳,特别是在长轨迹任务中。
  • 当前的环境仅限于Linux桌面,可能不适用于其他操作系统。

未来方向

未来工作可以扩展到其他操作系统,并改进模型在多应用程序任务中的表现。

AI 总览摘要

MyPCBench是一个新颖的基准测试,专注于评估个人智能计算代理在真实世界中的表现。现有的基准测试通常在无个性化的环境中进行,无法准确反映实际使用场景中的挑战。MyPCBench通过在Linux桌面上模拟17个真实世界的Web应用程序,提供了一个更真实的测试环境。

在实验中,Claude Opus 4.6在184个任务中完全解决了55.4%,显示了其在个性化任务中的强大能力。然而,模型在跨越多个应用程序的任务中表现不佳,特别是在长轨迹任务中。这表明当前的模型在处理复杂个性化需求时仍有改进空间。

MyPCBench的发布为研究人员和开发者提供了一个新的工具,可以更好地评估和改进个人智能计算代理的性能。未来的研究可以扩展到其他操作系统,并进一步优化模型在多应用程序任务中的表现。

深度分析

研究背景

随着个人智能计算代理的普及,评估其在真实世界中的表现变得越来越重要。现有的基准测试通常在无个性化的环境中进行,无法准确反映实际使用场景中的挑战。MyPCBench通过在Linux桌面上模拟17个真实世界的Web应用程序,提供了一个更真实的测试环境。

核心问题

现有基准测试在无个性化的环境中进行,无法准确评估个人助理在用户完整数字生活中的表现。这种差距在需要个性化和登录信息的Web任务中尤为明显。

核心创新

MyPCBench通过在完整的Linux桌面环境中引入一致的用户身份和跨应用历史,提供了一个可重复的评估平台。这种方法允许对个性化代理进行更真实的测试。

方法详解

  • �� 在Linux桌面上模拟17个真实世界的Web应用程序。
  • �� 使用统一的计算机和bash工具界面进行评估。
  • �� 每个任务基于真实请求,测试模型在个性化任务中的表现。

实验设计

实验在一个完整的Linux桌面环境中进行,包含17个模拟的Web应用程序和184个任务。使用统一的计算机和bash工具界面,评估六个模型在个性化任务中的表现。

结果分析

Claude Opus 4.6在184个任务中完全解决了55.4%,是唯一超过50%的模型。模型在跨越多个应用程序的任务中表现不佳,特别是在长轨迹任务中。

应用场景

MyPCBench为评估个人智能计算代理在用户完整数字生活中的表现提供了一个新的标准,适用于研究人员和开发者。

局限与展望

当前的环境仅限于Linux桌面,可能不适用于其他操作系统。模型在跨越多个应用程序的任务中表现不佳,特别是在长轨迹任务中。

通俗解读 非专业人士也能看懂

想象你有一个超级助理,它可以帮助你处理所有的电脑任务。MyPCBench就像是一个测试这个助理的模拟世界。在这个世界里,有17个不同的应用程序,比如银行、邮件和日历。每个应用程序都有你生活中的数据,比如银行交易和邮件。MyPCBench测试这些助理能否在这个复杂的环境中完成任务,比如支付账单或安排会议。通过这个测试,我们可以知道哪个助理最聪明,能最好地帮助你。

简单解释 像给14岁少年讲一样

想象一下,你有个超级智能的电脑助手,它能帮你处理所有的事情!MyPCBench就像是一个虚拟的测试场地,里面有17个不同的应用程序,比如银行、邮件和日历。每个应用程序都有你生活中的数据,比如银行交易和邮件。MyPCBench测试这些助手能否在这个复杂的环境中完成任务,比如支付账单或安排会议。通过这个测试,我们可以知道哪个助手最聪明,能最好地帮助你。

术语表

基准测试 (Benchmark)

一种用于评估系统或模型性能的标准化测试方法。

用于评估个人智能计算代理在MyPCBench中的表现。

个人助理 (Personal Assistant)

一种软件代理,旨在帮助用户完成个人任务。

MyPCBench测试个人助理在复杂任务中的表现。

Linux桌面 (Linux Desktop)

一种基于Linux操作系统的桌面环境。

MyPCBench在Linux桌面上进行测试。

Claude Opus 4.6

一种高性能的个人智能计算代理模型。

在MyPCBench中表现最佳的模型。

多应用 (Multi-application)

涉及多个应用程序的任务或环境。

MyPCBench测试模型在多应用任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在跨越多个应用程序任务中的表现?
  • 2 如何扩展MyPCBench以支持其他操作系统?

应用场景

近期应用

个性化助理评估

研究人员可以使用MyPCBench评估和改进个人智能计算代理的性能。

远期愿景

跨平台支持

未来可以扩展MyPCBench以支持其他操作系统,提高其适用性。

原文摘要

Current benchmarks for computer-use agents evaluate models in impersonal environments. This leaves a gap between evaluation and deployment where personal assistants are expected to work across a user's whole digital life, including their context, historical data, and logged-in accounts. This gap is widest on web tasks, where live web evaluations cannot exercise sites that require logging in or personal information, the kind of site a real personal assistant has to drive. We introduce MyPCBench, which tests computer-use agents as personal assistants on a Linux desktop populated with 17 simulated real-world web applications and a full desktop stack, all seeded for one canonical persona, Michael Scott from The Office. We define 184 tasks in this environment, each inspired by a real request drawn from the OpenClaw community, and benchmark six closed and open-weight models with a uniform computer+bash tool surface. We find that the best model, Claude Opus 4.6, fully solves 55.4\% of the tasks, the only model above 50\%. Model failures cluster on tasks that span many applications and on long trajectories, where personalization stresses an assistant the most. We release the environment, task set, and agent harness at https://mypcbench.com.

cs.LG cs.CL