跳到主要内容

“开源大模型”究竟开放了什么?

资料时间

本文内容截至 2026 年 7 月 30 日。模型版本、权重发布状态和许可证条款可能变化,具体信息应以官方页面为准。

近几年,每当一个大模型允许下载,新闻和自媒体往往立即宣布:“某某开源了。”

Kimi、GLM、DeepSeek、Qwen、Llama 等模型,都曾被广泛放进“开源大模型”这个篮子里。这个说法不一定完全错误,却经常过于粗糙:有的只公布了训练完成后的模型权重,有的使用附带限制的自定义许可证,有的开放了推理代码,却没有公开训练数据和完整训练流程。

它们的开放程度差别很大。把所有可下载模型都叫作“开源模型”,就像把“可以拆开机箱的电脑”都叫作“开源电脑”一样,会掩盖真正重要的问题。

一、先弄清楚:大模型究竟由什么组成

一个现代大模型不是单独的一份程序,至少包含以下几个部分:

部分通俗理解主要作用
模型架构大脑的结构设计决定信息如何流动和计算
训练数据教材和练习题决定模型接触过什么内容
数据处理流程教材的筛选、清洗和编排方法影响数据质量、比例与偏差
训练代码与配置学习方法和课程安排决定模型怎样从数据中学习
模型权重学习完成后的“大脑状态”保存训练产生的数十亿至数万亿个参数
推理代码让模型运转的程序接收问题并生成答案
后训练与对齐流程毕业后的专项训练形成对话、推理、工具调用及安全行为

传统软件的核心通常是源代码。大模型则不同:即使架构和推理代码完全公开,如果缺少权重,普通人仍然无法直接使用训练成果;反过来,即使拿到了权重,如果不知道训练数据、清洗方法和训练流程,也很难真正审计或重建它。

所以,“大模型是否开源”天然比“一个软件是否开源”更复杂。

二、开放权重是什么意思

所谓开放权重(open weights),核心含义是:开发者把训练完成后的模型参数提供出来,让其他人能够下载。

获得权重后,人们通常可以做以下事情:

  • 在自己的服务器上部署模型;
  • 不经过原厂 API 处理数据;
  • 对模型进行量化,以减少显存和内存占用;
  • 通过 LoRA、监督微调等方式适配特定任务;
  • 在许可证允许的范围内修改、再分发或用于商业产品。

但“能够下载”只说明技术文件可获得,并不自动意味着:

  • 允许任何人用于任何目的;
  • 允许商业使用;
  • 允许修改和再分发;
  • 公开了训练数据;
  • 公开了完整训练代码;
  • 能够从头复现同一个模型;
  • 普通电脑能够运行;
  • 整个模型属于严格意义上的开源 AI。

开放权重更像是把“训练好的成品大脑”交给社会使用。真正的开源还要追问:别人是否拥有研究、修改、重建和传播它所需要的自由与材料?

三、严格意义上的“开源 AI”是什么

目前较有影响力的严格标准,是开放源代码促进会(Open Source Initiative,OSI)发布的《开放源代码 AI 定义 1.0》。

按照该定义,开源 AI 应当给予所有人四项基本自由:

  1. 使用:可以出于任何目的使用,不必另行申请许可;
  2. 研究:可以检查其组成并研究它如何工作;
  3. 修改:可以为任何目的修改系统及其输出;
  4. 分享:可以传播原版或修改后的版本。

为了让这些自由不只是口号,还应当提供适合实际修改系统的材料,包括:

  • 模型参数或权重;
  • 完整的训练和运行代码;
  • 数据处理、过滤、验证、测试及训练配置;
  • 足够详细的训练数据信息,使专业人员能够构建一个实质等价的系统。

这里有一个容易误解的地方:OSI 并不要求所有原始训练数据都必须无条件公开。医疗、个人隐私、版权或其他数据可能无法合法再分发;但开发者应当充分说明数据来源、范围、特征、筛选和处理方法,并列出可以公开或依法取得的数据。OSI 对这一点有专门的解释

这套定义不是法律,也不是全行业已经无争议接受的唯一标准,但它提供了一个很有价值的判断原则:

开源不只是“文件放出来了”,而是其他人是否能够在无需再次请求原厂许可的情况下,有意义地使用、研究、修改和分享这个系统。

四、两个例子:同为“开放模型”,开放程度并不相同

以 Kimi 和 GLM 的当前代表性模型为例,就能看出“开放”不是非黑即白。

Moonshot AI 在官方页面中将 Kimi 明确称为 open-weight model。其权重可以下载,也允许广泛部署、微调和分发;但采用自定义许可证,对达到一定收入规模的“模型即服务”业务设置了另行授权要求,超大规模产品还可能承担品牌展示义务。许可证原文表明,它更适合被称为“自定义许可的开放权重模型”,而不是严格开源模型。

GLM 的情况更宽松。根据官方仓库模型页面,其当前代表性模型提供可下载权重,权重采用 MIT 许可,代码仓库采用 Apache 2.0,通常允许商业使用、修改和再分发。因此,将它称为“宽松许可的开放权重模型”是合理的。

但即使权重采用 MIT 或 Apache 2.0,也只能说明已经发布的材料如何使用,不能自动证明完整预训练数据、数据清洗流程和全部训练代码都已公开。按照 OSI 的严格定义,是否属于完整开源 AI,仍需逐项核验这些训练材料。

这两个例子不是为了贬低任何模型,而是说明:开放权重本身很有价值,但不同许可证赋予用户的权利并不相同,“开放程度高”也不必然等于“完整开源”。

五、媒体为什么总把“开放权重”写成“开源”

“开源”比“开放权重”更熟悉,也更容易传播。在实际产业语境中,人们说“开源模型”,很多时候只是想表达以下几件事:

  • 权重可以下载;
  • 不必只能调用官方 API;
  • 可以自行部署和微调;
  • 生态能够开发量化版、推理框架和衍生模型;
  • 相比完全封闭的模型,用户拥有更多控制权。

这是一种约定俗成的宽泛用法,并非每次都带有欺骗性。但当讨论商业合规、供应链安全、科研复现和技术审计时,这个简称就不够用了。

媒体报道中的问题大致可以分为三类:

  • 误用名词:把“权重可下载”“源代码可见”“免费使用”一律写成“开源”;
  • 误传事实:把尚未发布权重、只宣布未来开放,写成“已经开源”;
  • 误导读者:标题强调“完全开源、人人可用”,正文却不说明许可证限制、模型体积和部署成本。

其中还有一个非常常见的混淆:把公司、在线产品、模型家族和某个具体版本当成同一件事。例如,“OpenAI 有开放权重模型”并不代表其 GPT 旗舰模型开放了权重;“Qwen 有大量 Apache 2.0 模型”也不代表 Qwen 家族所有旗舰版本都可以下载。

这种写法有时只是记者对技术概念不熟悉,有时则来自企业市场宣传中的 open washing(开放洗白):利用“open”这个含义宽泛的词,让公众自然联想到传统开源软件所代表的自由、透明和社区协作,但实际只开放了部分材料。

因此,媒体在标题中最好使用“开放权重模型”“发布可下载权重”或“以某许可证发布”,而不是在没有核验许可证和训练材料时直接宣布“完全开源”。

尤其要警惕以下几种具体误导:

1. “免费下载”不等于开源

一个聊天产品可以免费使用,但模型权重和代码完全不公开。免费只是价格策略,开源讨论的是权利和材料。

2. “提供 API”不等于开放

API 只是远程调用入口。用户看不到模型权重,也无法控制服务端实际运行的版本。它更接近租用能力,而不是获得模型。

3. “代码在 GitHub”不等于整个模型开源

GitHub 仓库可能只包含演示代码、推理适配器或客户端 SDK。真正关键的权重、训练代码和数据流程可能仍未公开。

4. “许可证是 MIT”不等于训练体系全部开放

MIT 只能约束已经发布并明确纳入许可范围的材料。未发布的数据和代码不会因为仓库里出现一个 MIT 文件而自动开放。

5. “允许商用”不等于开源

有些自定义许可证允许绝大多数商业使用,却限制竞争性训练、特定领域、超大规模平台或模型服务业务。这类模型可能非常实用,但仍不符合“不限制使用领域”的经典开源原则。

6. “权重能下载”不等于普通人能本地运行

模型文件可能达到数百 GB,甚至 TB 级。量化可以压缩体积,但不会把超大模型自动变成适合手机或普通电脑的模型。参数规模、量化精度、上下文长度、内存带宽和推理框架都会影响可运行性。

六、主流模型的开放方式对比

下面的表格不是模型能力排行榜,而是一个开放方式速查表。模型更新很快,同一公司和同一家族也可能同时包含闭源、开放权重和不同许可证的版本,因此必须精确到具体型号。

模型是否开放,与其来自哪个国家没有必然关系,而是企业策略、具体版本、许可证和实际发布材料共同决定的。表格因此按公司和模型家族排列,不按国家划分阵营。

截至 2026 年 7 月 30 日;“宽松许可”只说明已发布权重和代码的使用条件,不自动证明完整训练体系符合 OSI 的开源 AI 定义。

公司与模型家族代表性模型权重能否下载许可证或提供方式更准确的称呼
OpenAI GPTGPT-5.6 SolChatGPT/API 服务闭源商业模型
OpenAI gpt-ossgpt-oss-120b、20bApache 2.0宽松许可的开放权重模型
Anthropic ClaudeClaude Opus 5、Fable 5Claude/API/云平台服务闭源商业模型
Google GeminiGemini 3.1 Pro、3.5 FlashGemini API、Vertex AI 等闭源商业模型
xAI GrokGrok 4.5Grok/API 服务当前旗舰为闭源商业模型
Meta LlamaLlama 4 Scout、MaverickLlama 4 Community License,含特定限制自定义许可的开放权重模型;不符合 OSI 的严格开源标准
Mistral AIMistral Large 3Apache 2.0宽松许可的开放权重模型
DeepSeekDeepSeek V4 Pro、Flash权重与仓库代码为 MIT宽松许可的开放权重模型
阿里巴巴 QwenQwen3.7-Max、Qwen3.6-35B-A3B视型号而定Max/Plus 等旗舰服务与 Apache 2.0 开放版本并存混合家族;不能笼统说“Qwen 全部开源”
Moonshot AI KimiKimi K3Kimi K3 License,部分大型商业服务需另行协议自定义许可的开放权重模型
智谱/Z.ai GLMGLM-5.2权重为 MIT,官方代码仓库为 Apache 2.0宽松许可的开放权重模型
MiniMaxMiniMax M3MiniMax Community License;大型商业收入触发授权条件自定义许可的开放权重模型
百度 ERNIEERNIE 5.1当前旗舰未见公开权重产品/API;较早的 ERNIE 4.5 有开放权重版本当前旗舰属于闭源商业模型;家族内存在开放版本
字节跳动 Seed/豆包Seed 2.1豆包、火山引擎 API当前旗舰为闭源商业模型

这张表揭示了三个经常被媒体标题抹掉的事实:

  1. 开放程度不能按国家归类。 任何国家都可能同时存在闭源模型、宽松许可的开放权重模型和自定义许可模型。
  2. 同一个家族内部也不统一。 Qwen 的部分模型采用 Apache 2.0 并开放权重,但 Max、Plus 等在线旗舰不能因此自动获得“开源”身份;Mistral 不同代际和型号也使用过 Apache 2.0、Modified MIT 和研究许可。
  3. 采用 MIT 或 Apache 2.0 是重要优点,但仍主要回答“已发布材料怎样使用”。 要判断整个 AI 系统是否达到完整开源,还要继续核验训练代码、数据处理流程和训练数据信息。

因此,“中国开源模型已经全面超过美国闭源模型”或“美国公司都拒绝开源”之类的标题,即使引用了某项真实评测,也通常把国家、公司、模型版本、许可证和能力排名混成了一个过度简化的结论。

七、判断一个“大模型开源”新闻,只需问六个问题

以后再看到“某模型正式开源”,可以按下面的顺序核实:

  1. 权重是否真的可以下载?

    只有网页聊天和 API,不属于开放权重。

  2. 下载的是什么权重?

    是完整基础模型、指令模型,还是经过删减、蒸馏或量化的版本?

  3. 采用什么许可证?

    不要只看发布会中的“open”字样,要打开 LICENSE 文件。

  4. 许可证是否限制用户、收入、用途或商业模式?

    “允许商用”后面可能还有规模门槛、展示义务或另行授权要求。

  5. 训练代码和数据处理流程开放到什么程度?

    推理代码能让模型跑起来,训练代码和数据信息才决定别人能否深入研究和重建。

  6. 自己的硬件是否真的能运行?

    “开放”解决的是获得权问题,不解决算力、显存、电力和运维成本。

八、一个更准确的开放程度光谱

与其把所有模型硬分成“开源”和“闭源”,不如把它们放在一条光谱上:

类型典型特征
封闭服务模型只能通过网页或 API 使用,权重不可得
可研究权重模型权重可申请或下载,但用途、传播或商业使用受较强限制
自定义许可的开放权重模型可部署和微调,但对部分用户、规模或用途设置额外条件
宽松许可的开放权重模型权重及推理代码允许广泛使用、修改、商用和再分发
完整开源 AI在上述基础上,还提供充分的训练代码、数据处理流程和数据信息,保障使用、研究、修改和分享四项自由

按照这个光谱:

  • Kimi 更适合归入“自定义许可的开放权重模型”;
  • GLM 的相应开放版本更适合归入“宽松许可的开放权重模型”;
  • 是否达到“完整开源 AI”,还需根据完整训练材料逐项判断。

至于现实中是否真的存在达到最后一级的模型,本文将在结语前给出调查结论。

九、普通用户真正应该关心什么

对普通用户而言,术语之争不是为了咬文嚼字,而是为了做出正确选择。

如果你只是在线聊天,最值得关心的是模型能力、价格、隐私政策和服务稳定性。

如果你想在自己的 Mac 或 PC 上运行,则要看:

  • 是否有可下载权重;
  • 是否存在适合设备的量化版本;
  • 模型实际需要多少内存和显存;
  • 推理框架是否支持自己的硬件;
  • 许可证是否允许预期用途。

如果你要把模型放进商业产品,还应检查:

  • 是否允许商用和再分发;
  • 是否有收入、用户量或行业限制;
  • 是否必须署名或展示模型品牌;
  • 衍生模型是否需要采用相同许可证;
  • 模型及训练数据可能带来的版权、隐私和合规风险。

如果你关心科研复现、算法审计或国家与企业的技术自主,则不能满足于“权重能下载”,而应继续追问训练数据来源、数据处理代码、训练配方、评测方法和硬件依赖。

十、调查结论:真正意义上的开源大模型存在吗?

存在,但数量很少,而且大多来自开放科学项目,而不是当前最热门的商业旗舰。

按照 OSI 的严格定义,真正开源的大模型不仅要提供权重,还要提供足够完整的训练代码、数据处理流程和训练数据信息,并允许任何人使用、研究、修改和分享。OSI 在制定定义时进行过一轮验证,认为以下系统通过了当时的验证阶段:

  • EleutherAI 的 Pythia;
  • AI2 的 OLMo;
  • LLM360 的 Amber 和 CrystalCoder;
  • Google 的 T5。

需要准确理解这份名单:它是 OSI 用于检验定义是否可行的初始验证结果,不是永久有效的产品认证,也不能自动覆盖这些家族后来发布的每一个版本。OSI 自己也明确表示,它通常验证许可证和定义,而不是持续认证每一个具体 AI 系统。OSI 验证结果

其中,AI2 的 OLMo 是今天最有代表性的完整开放案例之一。该项目不仅发布最终权重,还持续提供预训练数据、数据处理工具、训练代码、中间检查点、训练日志和评测工具。较新的 OLMo 3进一步公开了从预训练到后训练的完整模型流程,包括各阶段数据、依赖和检查点。它体现的不是“让模型可以下载”,而是“让外部研究者能够追踪、研究和修改模型是怎样被构建出来的”。

真正开源模型之所以稀少,并不神秘,主要因为:

  • 前沿模型训练成本极高,训练配方和数据管线往往被企业视为核心商业秘密;
  • 训练数据包含版权、隐私和商业授权问题,无法全部自由再分发;
  • 现代模型还包含复杂的后训练、偏好优化、安全对齐和评测流程,完整整理并开放的成本很高;
  • 商业公司希望开放生态,同时保留对超大客户、竞争性服务或特定用途的控制,因此更倾向采用自定义许可证;
  • 发布权重已经能带来大部分社区传播和生态收益,企业缺少继续公开完整训练体系的动力。

因此,当前公众熟悉的大多数所谓“开源大模型”,更准确地说仍是开放权重模型。其中一部分采用 MIT、Apache 2.0 等宽松许可证,开放程度很高;另一部分使用带有限制的自定义许可证。它们依然有重要价值,只是不能与 OLMo 这类公开完整模型生命周期的项目画等号。

最终调查结论可以概括为:

真正意义上的开源大模型确实存在;但“开放权重”是当前产业主流,“完整开源”仍是少数。判断时既不能把所有开放权重模型都说成完整开源,也不能反过来声称世界上根本不存在开源大模型。

结语:开放值得肯定,概念也应说准确

开放权重模型正在改变 AI 产业。它让开发者不必完全依赖少数公司的远程 API,让企业能够私有部署,让研究者能够分析和改造模型,也催生了量化、微调、推理优化和衍生模型生态。

但开放权重并不是完整开源的同义词。Kimi 与 GLM 的开放版本都具有重要价值,却代表了不同的许可证和开放层级。将它们不加区别地统称为“开源模型”,方便传播,却不足以支持严肃判断。

以后看到“某某大模型开源”,最值得问的不是“它强不强”,而是:

究竟开放了什么?以什么许可证开放?我获得了哪些权利?又缺少哪些材料?

能够回答这四个问题,才算真正读懂了一则“开源大模型”的新闻。


主要参考资料