核心发现
方法论
研究构建了包含505个任务的φ-Bench框架,涵盖文件系统设计与实现的六类任务。采用AI辅助任务生成流程,结合专家经验与教材内容,确保任务质量与覆盖面。对DeepSeek-V4-Flash、GLM-5.1、MiniMax-M2.7等开源模型及Claude-Opus-4.7、GPT-5.2、Gemini-3.1-Pro等商业模型进行实证评估,分析模型在不同任务中的表现、失败原因及缓解策略。
关键结果
- 模型在基础理解、实现、性能建模任务中表现优异,最高达95.8%的通过率。复杂任务如调试、优化、功能开发的成功率显著下降,分别为61.6%、37.6%、41.9%。模型失败主要源于语义误用、逻辑推理错误和边界情况缺失,且成本与性能相关性明显。通过提示工程和自我审查技术,提升模型表现,最大化模型在文件系统开发中的应用潜力。
- 不同模型在任务中的效率差异巨大,DeepSeek-V4-Flash成本最低,约为GPT-5.2的1/16至1/107。多次采样和上下文优化显著改善成功率,但仍有75%-79%的失败难以解决。模型在处理边界情况和性能优化方面表现不足,提示未来模型需强化推理深度和性能感知能力。
- 本研究为文件系统开发中的AI应用提供了系统化评估工具,揭示模型在设计决策、边界推理和性能优化中的瓶颈,为未来模型训练和任务设计提供指导。同时,提出的AI辅助任务生成流程具有推广价值,有助于构建其他专业领域的高质量基准体系。
研究意义
本研究填补了面向文件系统开发的LLM性能评估空白,为学术界和工业界提供了系统化工具,推动AI在复杂系统设计中的应用。通过细粒度任务划分,揭示模型在不同开发阶段的能力差异,有助于指导模型优化和定制化开发。研究成果促进了自动化软件工程、系统调试与性能优化的深度融合,为未来智能系统设计提供理论基础和实践路径。此框架的开源也将推动行业标准化和创新发展,降低研发成本,提升系统可靠性。
技术贡献
首次提出面向文件系统设计与实现的LLM基准框架φ-Bench,涵盖六类关键任务,细粒度评估模型能力。创新引入AI辅助任务生成流程,结合教材和源码,显著提升任务质量与覆盖面。系统分析模型在不同任务中的性能差异、失败原因及缓解策略,提供了详细的技术洞察。研究还探索了提示工程和多次采样等优化技术,有效提升模型表现,为未来模型训练和应用提供了技术指导。
新颖性
本研究首次针对文件系统开发任务构建系统化的基准框架,涵盖多样任务类型和模型能力评估。引入AI辅助任务生成流程,结合专家经验与教材内容,显著降低人工成本,提升任务质量。这在现有LLM评估中尚属创新,填补了系统性评估文件系统领域模型能力的空白,为后续模型优化和定制提供了基础。
AI 总览摘要
随着大规模语言模型(LLMs)在软件工程和系统开发中的应用不断深入,评估其在专业领域中的能力成为关键。本研究提出了φ-Bench,一套专为文件系统设计与实现任务构建的高质量基准框架。该框架由505个任务组成,涵盖理解、实现、性能建模、调试、优化和新功能开发六大类,全面反映文件系统开发的不同阶段与挑战。
为了确保任务的高质量与广泛覆盖,研究团队创新性地引入了AI辅助任务生成流程,结合Linux内核源码和教材内容,减少人工投入同时保证任务的专业性。所有任务经过专家双盲评审,AI生成的任务质量与人工任务相当,验证了流程的有效性。
在实证评估中,研究测试了包括DeepSeek-V4-Flash、GLM-5.1、MiniMax-M2.7等开源模型,以及Claude-Opus-4.7、GPT-5.2、Gemini-3.1-Pro等商业模型。结果显示,模型在基础理解、实现和性能建模任务中表现优异,成功率最高达95.8%;但在调试、优化和新功能开发方面表现较差,成功率分别为61.6%、37.6%、41.9%。失败原因主要包括语义误用、逻辑推理错误和边界情况缺失。
通过提示工程和多次采样等技术,模型表现得到了显著提升,但仍存在难以解决的持续性失败。研究强调模型在边界推理和性能感知方面的不足,提出未来应加强这两个方向的研究。该框架的开源将推动行业标准化和学术研究,为未来智能文件系统的自动化开发提供基础。
总体而言,φ-Bench为评估和提升LLMs在专业系统开发中的能力提供了系统工具,具有重要的理论和实践价值,有望引领智能系统设计的新时代。
深度解读
原文摘要
Large Language Models (LLMs) are fundamentally transforming computer system research and development. As we employ LLMs in file system (fs) development, it is essential to understand their capabilities, limitations, and operational efficiency for domain-specific tasks. We present φ-Bench, an LLM benchmarking framework for fs-specific tasks. To facilitate benchmarking, we develop six types of tasks in φ-Bench: basic understanding, basic implementation, performance modeling, debugging, optimization, and new feature development. Each type emphasizes different LLM capabilities: instruction following, knowledge recall, reasoning, or coding. To create high-quality tasks while achieving broad coverage with minimal human effort, we develop a new AI-assisted task generation pipeline in addition to expert-written and textbook-adapted tasks. With 505 tasks in φ-Bench, we conduct an empirical study with both open source (DeepSeek-V4-Flash, GLM-5.1, and MiniMax-M2.7) and proprietary (Claude-Opus-4.7, GPT-5.2, and Gemini-3.1-Pro) LLMs. Our study discloses the model efficiency for different tasks, causes of failed fs tasks, and techniques for mitigating LLM failures. We will open source φ-Bench to facilitate public research on using LLMs for fs development.