Who Uses Open-Weight Models? China and the Shifting Geography of AI in Science

TL;DR

采用混合NLP管线分析21百万篇论文,发现中国研究者更倾向使用开源模型,特别是Qwen和DeepSeek,2026年使用率达44%。

cs.CY 🔴 高级 2026-08-11 68 次浏览
Zackary Okun Dunivin
AI模型选择 开源模型 中国科研 模型生态 科学传播

核心发现

方法论

本研究利用混合自然语言处理(NLP)流程,从Semantic Scholar开放研究语料库(S2ORC)中提取论文全文中的模型提及。流程包括字典匹配、SciBERT分类器识别模型提及是否为实际使用,以及模型家族归属。通过训练基于大规模银标准标注的分类器,区分模型提及与使用,结合作者机构和作者姓名信息,分析模型选择的地域差异。采用逻辑回归和多项式模型,量化中国研究者在开源模型中的偏好,特别是Qwen和DeepSeek的集中使用。

关键结果

  • 2026年,44.0%的单模型论文采用开源模型,整体多模型论文中开源模型占比达87.2%。中国研究者在模型选择中表现出明显偏好,使用开源模型的概率是其他地区的2.23倍,贡献了2023年以来44%的开源模型采纳增长。Qwen在中国研究中的使用率达22%,在多模型论文中占比62.1%。Western开源模型Llama和Mistral则呈下降趋势。
  • 多模型论文中,Qwen、DeepSeek等中国模型的使用比例显著高于非中国论文,2026年中国机构论文中调整后使用率为37.1%,远高于无中国联系论文的9.2%。这表明模型生态的地理格局正发生转变,受国家政策、市场和文化影响,模型的科学应用逐渐偏向中国开发的开源模型。
  • 模型选择的地域差异在单模型论文中尤为明显,逻辑回归分析显示中国机构作者的开源模型使用概率是非中国机构的2.23倍。多项式模型进一步确认,Qwen等中国模型在中国研究中的占比远高于其他地区,反映出模型生态的地理重组。

研究意义

本研究揭示了AI模型生态的地理重组,强调模型选择不仅反映技术偏好,更受国家政策、市场环境和文化因素影响。中国研究者在开源模型中的偏好,彰显全球AI生态的区域差异,挑战了“开源即开放科学”的简单解读。研究为理解AI在科学中的应用提供了新的视角,推动模型生态的多样化与本土化发展,具有重要的政策和学术意义。

技术贡献

本研究创新性地结合大规模文本挖掘与统计模型,系统识别论文中的模型使用情况。提出基于字典匹配与SciBERT的多层分类框架,有效区分模型提及与实际使用。引入多项式与逻辑回归模型,量化地域差异,揭示中国研究者偏好中国本土开源模型的现象,为模型生态研究提供了新的分析工具和理论基础。

新颖性

首次系统性分析了科学论文中模型选择的地理差异,特别是中国研究者对开源模型的偏好。利用大规模文本挖掘与统计建模,揭示模型生态的空间重组,突破了传统问卷调研和案例研究的局限,为理解模型生态的动态演变提供了量化证据。

局限性

  • 本研究主要基于文本匹配和分类模型,可能存在漏检或误判,尤其在模型提及模糊或背景描述中。
  • 模型使用的地域归属主要依赖作者机构和姓名,可能受到机构归属变化或姓名歧义的影响。
  • 数据截止到2026年中,未来模型生态可能发生快速变化,需持续跟踪验证。

未来方向

未来将结合模型性能指标和实际应用场景,深入分析模型选择背后的动因。探索不同国家和地区的模型生态差异,推动构建全球化、多元化的AI模型使用地图。同时,结合政策分析,评估开源模型对科研公平和创新的影响。

AI 总览摘要

随着大规模语言模型(LLMs)在科学研究中的广泛应用,模型的选择逐渐成为研究焦点。本研究利用混合自然语言处理(NLP)技术,从超过2100万篇论文中系统识别模型提及与使用情况,揭示了模型生态的空间与时间演变。研究发现,2026年,44%的单模型论文采用开源模型,整体多模型论文中开源模型占比达87.2%。特别是中国开发的Qwen和DeepSeek模型在中国研究者中的使用率显著高于其他地区,Qwen在中国机构论文中的调整后使用率达37.1%,远超无中国联系论文的9.2%。这表明模型生态的地理重组不仅由技术因素驱动,更深受国家政策、市场和文化影响。研究采用字典匹配、SciBERT分类和统计模型,有效区分模型提及与实际使用,量化了中国研究者在模型选择中的偏好。结果显示,模型生态正向多元化与本土化发展,特别是在中国,开源模型的崛起成为新趋势。该研究不仅丰富了AI模型生态的理论理解,也为政策制定和科研实践提供了重要参考。未来,将结合模型性能和应用场景,深入分析模型选择背后的社会经济因素,推动全球AI生态的公平与创新。

深度解读

原文摘要

As LLMs have become a flashpoint for scientific research, computer scientists and STS scholars have advocated the use of open-weight models. Since LLM research has matured and more high-quality model families are available, have researchers adopted open-weight models? We present the first systematic study of model selection in scientific research, analyzing 21 million full-text articles through June 2026 from the Semantic Scholar Open Research Corpus (S2ORC). We employ a mixed NLP pipeline to extract model occurrences in article full text and determine whether they are used or merely mentioned by researchers. We divide our corpus into single- and multi-model family studies, which we take as a proxy for applied and foundational AI research. We find GPT-family models dominate both single- and multi-family research, but that both areas are becoming more diverse over time. In single-family papers, open-weight model use rises steadily, reaching 44.0% in 2026. However, we find that recent growth is driven by the availability of high-quality open-weight Chinese models. Further, a logistic regression model finds that open-weight adoption is heterogeneously distributed, estimating that researchers at Chinese institutions have 2.23 times the odds of using an open-weight model, accounting for 44.0% of the increase in open-weight adoption since 2023. A complementary multinomial model shows this association is concentrated in Chinese open-weight models: in 2026, their adjusted use is 37.1% among papers with Chinese affiliations, a 27.9 percentage-point over papers with no observed China link. These findings suggest that open-weight adoption in science is not a general turn toward open science, but part of a broader realignment of model ecosystems in which platforms and markets, and the sociocultural and geopolitical contexts which shape them, determine which AI systems become scientific instruments.

cs.CY