“开源大模型”究竟开放了什么?
本文内容截至 2026 年 7 月 30 日。模型版本、权重发布状态和许可证条款可能变化,具体信息应以官方页面为准。
近几年,每当一个大模型允许下载,新闻和自媒体往往立即宣布:“某某开源了。”
Kimi、GLM、DeepSeek、Qwen、Llama 等模型,都曾被广泛放进“开源大模型”这个篮子里。这个说法不一定完全错误,却经常过于粗糙:有的只公布了训练完成后的模型权重,有的使用附带限制的自定义许可证,有的开放了推理代码,却没有公开训练数据和完整训练流程。
它们的开放程度差别很大。把所有可下载模型都叫作“开源模型”,就像把“可以拆开机箱的电脑”都叫作“开源电脑”一样,会掩盖真正重要的问题。
一、先弄清楚:大模型究竟由什么组成
一个现代大模型不是单独的一份程序,至少包含以下几个部分:
| 部分 | 通俗理解 | 主要作用 |
|---|---|---|
| 模型架构 | 大脑的结构设计 | 决定信息如何流动和计算 |
| 训练数据 | 教材和练习题 | 决定模型接触过什么内容 |
| 数据处理流程 | 教材的筛选、清洗和编排方法 | 影响数据质量、比例与偏差 |
| 训练代码与配置 | 学习方法和课程安排 | 决定模型怎样从数据中学习 |
| 模型权重 | 学习完成后的“大脑状态” | 保存训练产生的数十亿至数万亿个参数 |
| 推理代码 | 让模型运转的程序 | 接收问题并生成答案 |
| 后训练与对齐流程 | 毕业后的专项训练 | 形成对话、推理、工具调用及安全行为 |
传统软件的核心通常是源代码。大模型则不同:即使架构和推理代码完全公开,如果缺少权重,普通人仍然无法直接使用训练成果;反过来,即使拿到了权重,如果不知道训练数据、清洗方法和训练流程,也很难真正审计或重建它。
所以,“大模型是否开源”天然比“一个软件是否开源”更复杂。
二、开放权重是什么意思
所谓开放权重(open weights),核心含义是:开发者把训练完成后的模型参数提供出来,让其他人能够下载。
获得权重后,人们通常可以做以下事情:
- 在自己的服务器上部署模型;
- 不经过原厂 API 处理数据;
- 对模型进行量化,以减少显存和内存占用;
- 通过 LoRA、监督微调等方式适配特定任务;
- 在许可证允许的范围内修改、再分发或用于商业产品。
但“能够下载”只说明技术文件可获得,并不自动意味着:
- 允许任何人用于任何目的;
- 允许商业使用;
- 允许修改和再分发;
- 公开了训练数据;
- 公开了完整训练代码;
- 能够从头复现同一个模型;
- 普通电脑能够运行;
- 整个模型属于严格意义上的开源 AI。
开放权重更像是把“训练好的成品大脑”交给社会使用。真正的开源还要追问:别人是否拥有研究、修改、重建和传播它所需要的自由与材料?
三、严格意义上的“开源 AI”是什么
目前较有影响力的严格标准,是开放源代码促进会(Open Source Initiative,OSI)发布的《开放源代码 AI 定义 1.0》。
按照该定义,开源 AI 应当给予所有人四项基本自由 :
- 使用:可以出于任何目的使用,不必另行申请许可;
- 研究:可以检查其组成并研究它如何工作;
- 修改:可以为任何目的修改系统及其输出;
- 分享:可以传播原版或修改后的版本。
为了让这些自由不只是口号,还应当提供适合实际修改系统的材料,包括:
- 模型参数或权重;
- 完整的训练和运行代码;
- 数据处理、过滤、验证、测试及训练配置;
- 足够详细的训练数据信息,使专业人员能够构建一个实质等价的系统。
这里有一个容易误解的地方:OSI 并不要求所有原始训练数据都必须无条件公开。医疗、个人隐私、版权或其他数据可能无法合法再分发;但开发者应当充分说明数据来源、范围、特征、筛选和处理方法,并列出可以公开或依法取得的数据。OSI 对这一点有专门的解释。
这套定义不是法律,也不是全行业已经无争议接受的唯一标准,但它提供了一个很有价值的判断原则:
开源不只是“文件放出来了”,而是其他人是否能够在无需再次请求原厂许可的情况下,有意义地使用、研究、修改和分享这个系统。
四、两个例子:同为“开放模型”,开放程度并不相同
以 Kimi 和 GLM 的当前代表性模型为例,就能看出“开放”不是非黑即白。
Moonshot AI 在官方页面中将 Kimi 明确称为 open-weight model。其权重可以下载,也允许广泛部署、微调和分发;但采用自定义许可证,对达到一定收入规模的“模型即服务”业务设置了另行授权要求,超大规模产品还可能承担品牌展示义务。许可证原文表明,它更适合被称为“自定义许可的开放权重模型”,而不是严格开源模型。
GLM 的情况更宽松。根据官方仓库和模型页面,其当前代表性模型提供可下载权重,权重采用 MIT 许可,代码仓库采用 Apache 2.0,通常允许商业使用、修改和再分发。因此,将它称为“宽松许可的开放权重模型”是合理的。
但即使权重采用 MIT 或 Apache 2.0,也只能说明已经发布的材料如何使用,不能自动证明完整预训练数据、数据清洗流程和全部训练代码都已公开。按照 OSI 的严格定义,是否属于完整开源 AI,仍需逐项核验这些训练材料。
这两个例子不是为了贬低任何模型,而是说明:开放权重本身很有价值,但不同许可证赋予用户的权利并不相同,“开放程度高”也不必然等于“完整开源”。
五、媒体为什么总把“开放权重”写成“开源”
“开源”比“开放权重”更熟悉,也更容易传播。在实际产业语境中,人们说“开源模型”,很多时候只是想表达以下几件事:
- 权重可以下载;
- 不必只能调用官方 API;
- 可以自行部署和微调;
- 生态能够开发量化版、推理框架和衍生模型;
- 相比完全封闭的模型,用户拥有更多控制权。
这是一种约定俗成的宽泛用法,并非每次都带有欺骗性。但当讨论商业合规、供应链安全、科研复现和技术审计时,这个简称就不够用了。
媒体报道中的问题大致可以分为三类:
- 误用名词:把“权重可下载”“源代码可见”“免费使用”一律写成“开源”;
- 误传事实:把尚未发布权重、只宣布未来开放,写成“已经开源”;
- 误导读者:标题强调“完全开源、人人可用”,正文却不说明许可证限制、模型体积和部署成本。
其中还有一个非常常见的混淆:把公司、在线产品、模型家族和某个具体版本当成同一件事。例如,“OpenAI 有开放权重模型”并不代表其 GPT 旗舰模型开放了权重;“Qwen 有大量 Apache 2.0 模型”也不代表 Qwen 家族所有旗舰版本都可以下载。
这种写法有时只是记者对技术概念不熟悉,有时则来自企业市场宣传中的 open washing(开放洗白):利用“open”这个含义宽泛的词,让公众自然联想到传统开源软件所代表的自由、透明和社区 协作,但实际只开放了部分材料。
因此,媒体在标题中最好使用“开放权重模型”“发布可下载权重”或“以某许可证发布”,而不是在没有核验许可证和训练材料时直接宣布“完全开源”。
尤其要警惕以下几种具体误导:
1. “免费下载”不等于开源
一个聊天产品可以免费使用,但模型权重和代码完全不公开。免费只是价格策略,开源讨论的是权利和材料。
2. “提供 API”不等于开放
API 只是远程调用入口。用户看不到模型权重,也无法控制服务端实际运行的版本。它更接近租用能力,而不是获得模型。
3. “代码在 GitHub”不等于整个模型开源
GitHub 仓库可能只包含演示代码、推理适配器或客户端 SDK。真正关键的权重、训练代码和数据流程可能仍未公开。
4. “许可证是 MIT”不等于训练体系全部开放
MIT 只能约束已经发布并明确纳入许可范围的材料。未发布的数据和代码不会因为仓库里出现一个 MIT 文件而自动开放。
5. “允许商用”不等于开源
有些自定义许可证允许绝大多数商业使用,却限制竞争性训练、特定领域、超大规模平台或模型服务业务。这类模型可能非常实用,但仍不符合“不限制使用领域”的经典开源原则。
6. “权重能下载”不等于普通人能本地运行
模型文件可能达到数百 GB,甚至 TB 级。量化可以压缩体积,但不会把超大模型自动变成适合手机或普通电脑的模型。参数规模、量化精度、上下文长度、内存带宽和推理框架都会影响可运行性。
六、主流模型的开放方式对比
下面的表格不是模型能力排行榜,而是一个开放方式速查表。模型更新很快,同一公司和同一家族也可能同时包含闭源、开放权重和不同许可证的版本,因此必须精确到具体型号。
模型是否开放,与其来自哪个国家没有必然关系,而是企业策略、具体版本、许可证和实际发布材料共同决定的。表格因此按公司和模型家族排列,不按国家划分阵营。
截至 2026 年 7 月 30 日;“宽松许可”只说明已发布权重和代码的使用条件,不自动证明完整训练体系符合 OSI 的开源 AI 定义。
| 公司与模型家族 | 代表性模型 | 权重能否下载 | 许可证或提供方式 | 更准确的称呼 |
|---|---|---|---|---|
| OpenAI GPT | GPT-5.6 Sol | 否 | ChatGPT/API 服务 | 闭源商业模型 |
| OpenAI gpt-oss | gpt-oss-120b、20b | 是 | Apache 2.0 | 宽松许可的开放权重模型 |
| Anthropic Claude | Claude Opus 5、Fable 5 | 否 | Claude/API/云平台服务 | 闭源商业模型 |
| Google Gemini | Gemini 3.1 Pro、3.5 Flash | 否 | Gemini API、Vertex AI 等 | 闭源商业模型 |
| xAI Grok | Grok 4.5 | 否 | Grok/API 服务 | 当前 旗舰为闭源商业模型 |
| Meta Llama | Llama 4 Scout、Maverick | 是 | Llama 4 Community License,含特定限制 | 自定义许可的开放权重模型;不符合 OSI 的严格开源标准 |
| Mistral AI | Mistral Large 3 | 是 | Apache 2.0 | 宽松许可的开放权重模型 |
| DeepSeek | DeepSeek V4 Pro、Flash | 是 | 权重与仓库代码为 MIT | 宽松许可的开放权重模型 |
| 阿里巴巴 Qwen | Qwen3.7-Max、Qwen3.6-35B-A3B 等 | 视型号而定 | Max/Plus 等旗舰服务与 Apache 2.0 开放版本并存 | 混合家族;不能笼统说“Qwen 全部开源” |
| Moonshot AI Kimi | Kimi K3 | 是 | Kimi K3 License,部分大型商业服务需另行协议 | 自定义许可的开放权重模型 |
| 智谱/Z.ai GLM | GLM-5.2 | 是 | 权重为 MIT,官方代码仓库为 Apache 2.0 | 宽松许可的开放权重模型 |
| MiniMax | MiniMax M3 | 是 | MiniMax Community License;大型商业收入触发授权条件 | 自定义许可的开放权重模型 |
| 百度 ERNIE | ERNIE 5.1 | 当前旗舰未见公开权重 | 产品/API;较早的 ERNIE 4.5 有开放权重版本 | 当前旗舰属于闭源商业模型;家族内存在开放版本 |
| 字节跳动 Seed/豆包 | Seed 2.1 | 否 | 豆包、火山引擎 API | 当前旗舰为闭源商业模型 |
这张表揭示了三个经常被媒体标题抹掉的事实:
- 开放程度不能按国家归类。 任何国家都可能同时存在闭源模型、宽松许可的开放权重模型和自定义许可模型。
- 同一个家族内部也不统一。 Qwen 的部分模型采用 Apache 2.0 并开放权重,但 Max、Plus 等在线旗舰不能因此自动获得“开源”身份;Mistral 不同代际和型号也使用过 Apache 2.0、Modified MIT 和研究许可。
- 采用 MIT 或 Apache 2.0 是重要优点,但仍主要回答“已发布材料怎样使用”。 要判断整个 AI 系统是否达到完整开源,还要继续核验训练代码、数据处理流程和训练数据信息。
因此,“中国开源模型已经全面超过美国闭源模型”或“美国公司都拒绝开源”之类的标题,即使引用了某项真实评测,也通常把国家、公司、模型版本、许可证和能力排名混成了一个过度简化的结论。