数据与中国的“开放”人工智能模型†

Basudev Shrestha, Communist Flag
(Publicdomainpictures.net)
月之暗面(Moonshot AI)旗下 Kimi K3 模型取得广泛应用,引发了对此中国人工智能新模型成功秘诀的浓厚兴趣。Kimi K3 常被误称为“开源”模型——这一术语意味着完全透明——但实际上它仅属于“开放权重”模型,即仅披露了模型的的“最终权重与偏置”,而训练数据集等关键要素则未予披露。
鉴于 Moonshot AI 的持续成功有望助力中国在全球人工智能竞赛中胜出——或至少实现重大进步——中国领导层可能会因而允许该公司获取海量数据来训练 Kimi K4(预计其性能将远超 Kimi K3)。了解中国如何构建数据集并采取严格的数据保护措施,有助于人工智能竞赛的其他参与者更能战略性地权衡自身选择。
数据采集
中国正在建设的物流数据新系统,让我们得以一窥该国广泛地获取数据的能力。
2025年11月,中国国家发展和改革委员会联合数据、网信、民航、铁路等领域的九个主管部门,共同发布了一项关于构建互联物流数据库的实施方案。
该方案的开篇段落将物流形容为中国实体经济的“筋络”,意指物流在联接生产和消费、联接内贸和外贸方面发挥着重要作用。该段落随后阐述道,推动物流数据的开放与互联,是“提升资源配置效率”和“畅通实体经济循环”的重要举措。
鉴于物流数据的重要性,该方案指出需在物流领域拓展人工智能、区块链等技术的规模化应用,以实现物流数据的“实时采集、广泛连接和高效汇聚”。目前,政府机构及各类企业正被动员起来,为这一努力贡献力量。该方案在其“国家物流公共数据共享开放清单”中,明确了政府部门需共享的物流数据及更新这些数据的频率。此外,骨干物流企业与平台企业被鼓励共同构建物流行业可信数据空间,并建立健全数据采集、提取、应用及保护机制。
“在中国构建其他数据集的过程中,很可能也会采用同样广泛的方法。”
在中国构建其他数据集的过程中,很可能也会采用同样广泛的方法。根据中国国民经济和社会发展五年规划(2026–2030年),中国正致力于“面向能源、交通、制造、教育、健康、金融等领域建设高质量数据集”。
数据保护
鉴于中国领导高度重视动员全社会力量(包括民营企业)来构建互联的数据系统,该国出台更多确保数据安全的法律规则绝非巧合。其中,国务院为“维护国家主权、安全、发展利益”等目标而公布的两项行政法规尤为值得关注。
首先,于2026年7月1日生效的《国务院关于对外投资的规定》对开展对外投资活动的投资者施加了多项限制。例如,这些投资者不仅被禁止出口“国家禁止出口的[…]数据”,还被要求不得通过“跨境派遣技术人员、组织人员赴其他国家(地区)工作、跨境提供技术指导、安排人员跨境培训”等方式,将此类禁止出口的数据转移至其他国家(地区)。
其次,将于2026年9月15日生效的《国务院关于出境入境管理的规定》进一步收紧了管控措施。例如,如果中国公民被认为违反技术出口规定,且可能危害“国家产业安全、技术安全”,包括商务部在内的国务院“有关主管部门”获授权决定不准其出境。此外,尽管作出不准某人出境决定的机关通常须向当事人“书面告知不准出境的事实、理由、依据和救济途径”,但在“有可能影响国家安全、刑事案件侦查等情形”下,可以不予此类告知。
对中国竞争对手的启示
“中国动员全社会力量构建高价值数据集的能力,以及其为防止数据外泄而不惜采取极端且含糊的规则的行事风格,给其竞争对手带来了挑战。”
中国动员全社会力量构建高价值数据集的能力,以及其为防止数据外泄而不惜采取极端且含糊的规则的行事风格,给其竞争对手带来了挑战。对于那些必须遵循其国家旨在保护实体的专有数据所有权和个人行动自由的法律原则的竞争对手而言,这些挑战尤其巨大。
面对中国在构建数据集方面所拥有的竞争优势,这些竞争对手若能克服彼此间的分歧,并削弱中国获取构建强大人工智能模型所需的其他资源(如芯片、资金和人才)的能力,或许他们更有机会保持竞争力。然而,如果当今世界的分裂态势持续加剧,中国将愈发确信其竞争对手之间不太可能形成这种团结。这些竞争对手会采取协同行动来证明中国的判断是错误的吗?
- 此文章的引用是:丝络谈®编辑委员会,数据与中国的“开放”人工智能模型,丝络谈®,丝络速递™,2026年8月12日,https://zh.sinotalks.com/sinoexpress/china-open-ai-data。↩︎




