LLMoxie: Exploring Agentic AI for Scientific Software Development

TL;DR

LLMoxie平台通过三层架构和RSE-Plugins生态系统提升科学软件开发中的AI代理性能。

cs.SE 🔴 高级 2026-07-03 8 次浏览
Landung Setiawan Anant Mittal Cordero Core Anshul Tambay Carlos Garcia Jurado Suarez David A. C. Beck Andrew J. Connolly Vani Mandava
科学软件 AI代理 RSE 多云推理 插件生态系统

核心发现

方法论

LLMoxie平台采用三层架构:推理层支持多云和本地推理,控制平面负责认证和预算管理,应用增强层通过RSE-Plugins提供领域特定的工作流。RSE-Plugins通过插件-代理-技能层次结构将科学Python实践和领域知识编码为可重用的上下文。

关键结果

  • 在20个月的实践中,LLMoxie平台成功将AI代理从通用代码生成器转变为领域感知的协作者,显著提高了科学软件的可审计性和可复现性。
  • RSE-Plugins有效地将科学Python社区的惯例和专业RSE学科的实践编码为可重用的知识模块。
  • 平台在天文学、地球与气候科学等多个领域的项目中表现出色,解决了AI代理在科学软件开发中的适配问题。

研究意义

LLMoxie平台通过将AI代理转变为领域感知的协作者,解决了科学软件开发中AI代理适配性差的问题,推动了AI在科学研究中的负责任集成。其三层架构和插件生态系统为科学软件提供了可审计的技术推理路径,提升了软件的可引用性、可审计性和可扩展性。

技术贡献

LLMoxie通过其三层架构和RSE-Plugins生态系统提供了一个新的AI编排平台,整合了检索系统、科学工具和研究知识库。其创新在于将AI代理从通用代码生成器转变为领域感知的协作者,提供了新的工程可能性。

新颖性

LLMoxie是首个将AI代理与科学软件开发中的领域知识和社区惯例深度结合的平台。其RSE-Plugins生态系统通过插件-代理-技能层次结构提供了可重用的上下文,显著提升了AI代理的适配性。

局限性

  • 平台对特定领域的适配仍需进一步优化,尤其是在新兴科学领域中。
  • 对敏感数据的处理能力有限,需进一步增强数据治理机制。

未来方向

未来工作包括扩展RSE-Plugins生态系统以覆盖更多科学领域,并进一步优化平台对敏感数据的处理能力。探索更多AI代理在科学软件开发中的应用场景。

AI 总览摘要

LLMoxie平台通过其三层架构和RSE-Plugins生态系统,解决了科学软件开发中AI代理适配性差的问题。现有AI代理通常忽略科学Python库的惯例,处理敏感数据不当,且决策路径难以重建。LLMoxie通过多云推理、LiteLLM/MLflow控制平面和应用增强层,将AI代理转变为领域感知的协作者,提供可审计的技术推理路径。

在20个月的实践中,LLMoxie平台在天文学、地球与气候科学等多个领域的项目中表现出色,解决了AI代理在科学软件开发中的适配问题。RSE-Plugins通过插件-代理-技能层次结构,将科学Python社区的惯例和专业RSE学科的实践编码为可重用的知识模块。

LLMoxie平台为科学软件提供了一个新的AI编排平台,整合了检索系统、科学工具和研究知识库,推动了AI在科学研究中的负责任集成。未来工作将扩展RSE-Plugins生态系统以覆盖更多科学领域,并进一步优化平台对敏感数据的处理能力。

深度分析

研究背景

科学软件开发面临的挑战在于如何在保证代码质量的同时,确保软件的可引用性、可审计性和可扩展性。现有AI代理通常针对商业软件优化,忽略了科学Python库的惯例,处理敏感数据不当,且决策路径难以重建。

核心问题

科学软件的开发不仅需要高质量的代码,还需要确保软件的可引用性、可审计性和可扩展性。现有AI代理在科学软件开发中适配性差,难以满足这些要求。

核心创新

LLMoxie平台通过三层架构和RSE-Plugins生态系统,将AI代理转变为领域感知的协作者。其创新在于通过插件-代理-技能层次结构,将科学Python社区的惯例和专业RSE学科的实践编码为可重用的上下文。

方法详解

  • �� 推理层支持多云和本地推理,灵活适应不同的基础设施需求。
  • �� 控制平面通过LiteLLM和MLflow提供统一的API访问,支持认证、预算管理和PII屏蔽。
  • �� 应用增强层通过RSE-Plugins提供领域特定的工作流,提升AI代理的适配性。

实验设计

在20个月的实践中,LLMoxie平台在天文学、地球与气候科学等多个领域的项目中表现出色。通过RSE-Plugins将科学Python社区的惯例和专业RSE学科的实践编码为可重用的知识模块。

结果分析

LLMoxie平台成功将AI代理从通用代码生成器转变为领域感知的协作者,显著提高了科学软件的可审计性和可复现性。RSE-Plugins有效地将科学Python社区的惯例和专业RSE学科的实践编码为可重用的知识模块。

应用场景

LLMoxie平台可广泛应用于科学软件开发中的AI代理适配问题,尤其在天文学、地球与气候科学等领域。其插件生态系统提供了可重用的上下文,提升了AI代理的适配性。

局限与展望

平台对特定领域的适配仍需进一步优化,尤其是在新兴科学领域中。对敏感数据的处理能力有限,需进一步增强数据治理机制。未来工作将扩展RSE-Plugins生态系统以覆盖更多科学领域。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。LLMoxie就像一个聪明的助手,它不仅能帮你准备食材,还能根据你的口味调整菜谱。它了解每种食材的特性,知道如何搭配才能做出美味的菜肴。RSE-Plugins就像是你厨房里的各种工具和调料,帮助你更好地完成烹饪任务。这个助手不仅能帮你做出美味的菜,还能记录下每一步的过程,以便下次再用。

简单解释 像给14岁少年讲一样

想象一下,你在玩一个超级复杂的游戏,需要同时管理很多角色。LLMoxie就像是一个超级助手,它不仅能帮你管理这些角色,还能根据不同的场景给出最佳策略。RSE-Plugins就像是游戏中的各种道具和技能,帮助你更好地完成任务。这个助手不仅能帮你赢得游戏,还能记录下每一步的策略,以便下次再用。

术语表

LLMoxie

一个支持科学软件开发的AI平台,采用三层架构和RSE-Plugins生态系统。

用于提升AI代理在科学软件开发中的适配性。

RSE-Plugins

一个插件-代理-技能层次结构,编码科学Python实践和领域知识。

为AI代理提供可重用的上下文。

多云推理

支持在多个云平台上进行推理的能力。

LLMoxie平台的推理层支持多云推理。

LiteLLM/MLflow

用于控制平面的工具,提供统一的API访问和治理机制。

用于LLMoxie平台的控制平面。

科学Python社区

一个专注于科学计算的Python开发者社区。

RSE-Plugins通过编码其惯例为AI代理提供上下文。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化平台对新兴科学领域的适配能力?
  • 2 如何增强平台对敏感数据的处理能力?
  • 3 如何扩展RSE-Plugins生态系统以覆盖更多领域?

应用场景

近期应用

科学软件开发

提升AI代理在科学软件开发中的适配性,尤其在天文学、地球与气候科学等领域。

远期愿景

跨领域AI集成

推动AI在更多科学领域的负责任集成,提升科学研究的效率和准确性。

原文摘要

In this paper, we describe LLMoxie, an institutional AI platform whose three-tiered architecture supports multi-cloud and on-premise inference, a LiteLLM/MLflow control plane for authentication, budgeting, PII masking, and observability, and an application augmentation layer for AI coding agents. Layered on top, an open-source RSE-Plugins ecosystem encodes accumulated RSE knowledge as a Plugin-Agent-Skill hierarchy spanning scientific Python practice, domain-specific knowledge, a six-phase research-and-implement workflow, and project lifecycle management. Scientific software is judged less by raw code quality than by whether it can be cited, audited, reproduced, and extended. Off-the-shelf AI coding agents, optimized against commercial software benchmarks, are poorly calibrated for this setting: they ignore the conventions of the scientific Python libraries they invoke, mishandle sensitive or embargoed data, and leave decision trails that are difficult to reconstruct after the fact. We report on twenty months of practice at a university-based research software engineering (RSE) center, where RSEs embedded across astronomy, earth and climate science, agriculture, and health projects worked to close this gap. We characterize the recurring infrastructure, governance, and process challenges of adopting Agentic AI inside a multi-domain RSE center, describe the platform and plugin design, and distill operational lessons from real scientific software deployments. Together, the platform and plugins shift AI coding agents from generic code generators into domain-aware collaborators that respect community norms and produce auditable provenance of technical reasoning.

cs.SE cs.AI cs.DC cs.MA