一文梳理清楚生成式 AI 与大模型的相关知识和概念
阅读对象:有一点“生成式 AI / 大模型 / AI 模型”概念的初学者,以及想理解 ChatGPT、Claude、GLM、OpenRouter、阿里云百炼、腾讯云 TokenHub、Ollama 本地模型、AI Agent、多模态和视频生成工具等服务区别的普通用户。
资料时间:截至 2026 年 6 月 25 日。生成式 AI 模型、芯片和云服务变化很快,具体模型规格、价格和可用地区应以官方页面为准。
0. 先给结论
这里说的“生成式 AI(Generative AI)与大模型(large model)”,主要指 ChatGPT、Claude、Gemini、GLM、Qwen、DeepSeek、Sora、Seedance、AI Agent 等这一代以基础模型(foundation model)为核心、能生成文字 / 图片 / 语音 / 视频 / 代码并调用工具的 AI 体系。它不同于更早的传统 AI 应用,比如单一分类、识别、推荐、搜索排序或规则系统。
日常使用的大多数生成式 AI / 大模型服务,本质上可以拆成三层;如果扩展到多模态(multimodal)和 AI Agent,还要分别关注“模型处理什么模态”和“谁负责把任务持续推进下去”:
第一层:模型从哪里来
也就是训练:谁训练了 GPT、Claude、GLM、Qwen、DeepSeek、Llama 等模型。
第二层:模型在哪里运行
也就是推理:你的问题发到哪里,由哪台机器、哪些芯片把答案算出来。
第三层:你通过什么产品或系统使用它
例如 ChatGPT、Claude、智谱开放平台、OpenRouter、阿里云百炼、腾讯云 TokenHub、Ollama、本地网页 UI、企业私有部署等。
多模态层:模型处理哪些输入和输出
例如文字、图片、语音、视频、音频、代码、PDF、屏幕截图等。
Agent 编排层(agent orchestration):谁来规划步骤、调用工具、读写记忆、处理失败、等待人工确认
例如代码 Agent、客服 Agent、办公自动化 Agent、企业流程 Agent、研究助理 Agent 等。
所以,OpenAI、Claude、GLM、Qwen、DeepSeek 这些名字,很多时候指的是“模型或模型厂商”;而 OpenRouter、阿里云百炼、腾讯云 TokenHub、AWS Bedrock、Google Vertex AI 这类平台,更多时候是“模型服务平台 / 云端推理(cloud inference)入口 / 模型聚合与托管平台”;Ollama、llama.cpp、LM Studio 则更偏“本地推理运行器(local inference runtime)”。AI Agent 不是和这些并列的新模型,而是把模型、工具、数据、权限和执行流程组织起来的一种应用形态。
一句话概括:
训练(training)是把模型造出来;推理(inference)是把已经造好的模型拿来回答问题;多模态只是把文字扩展到图片、语音、视频等输入输出;Agent 是把一次次推理和工具调用(tool calling)组织成可持续推进的任务流程。
1. 一个普通问题背后发生了什么?
假设你在 ChatGPT、Claude、GLM 或一个接入 OpenRouter 的代码助手里输入:
帮我分析这段代码哪里可能有 bug。
背后大致发生的是:
用户输入
↓
客户端 / 网页 / App / 插件
↓
API 网关:鉴权、计费、限流、安全检查
↓
模型服务层:选择模型、调度 GPU/NPU、加载上下文
↓
推理引擎:把文字切成 token,运行模型前向计算(forward pass)
↓
逐 token 生成答案
↓
返回给用户
这个过程通常不会重新训练模型。它是在调用已经训练好的模型权重,做一次或多次推理。
如果这个服务接了 网页搜索、数据库、代码执行器、文件检索、企业知识库,那么中间还会多出一层:
模型判断需要工具
↓
系统调用搜索 / 数据库 / 代码执行 / 文件检索
↓
把工具结果再交给模型
↓
模型综合结果生成回答
这也是为什么现在的生成式 AI 服务看起来不只是“聊天模型”,而更像“模型 + 工具 + 数据 + 权限 + 云端调度系统”的组合。
如果产品进一步做成 AI Agent,流程会变成循环,而不只是一次问答:
用户给出目标
↓
Agent 理解任务、拆解步骤、判断风险
↓
模型生成计划或下一步动作
↓
系统按权限调用工具:搜索、数据库、代码仓库、浏览器、邮件、工单、终端等
↓
Agent 观察工具结果,更新上下文或记忆
↓
继续下一轮推理和工具调用
↓
完成任务,或在高风险步骤前请求人工确认
因此,Agent 的关键不只是“模型更聪明”,而是系统能否稳定地管理 目标、状态(state)、工具、权限、记忆(memory)、错误恢复和人工介入(human-in-the-loop)。同一个模型,放在普通聊天框里、代码编辑器里、企业工单系统里,能完成的任务会很不一样。