LLM 时代商业模式展望

核心判断

LLM 时代的商业模式不会停留在“订阅还是 API”这个二分法。更稳定的结构会是:订阅买入口和确定性,用量买真实算力,优先级买延迟和容量,成果计费买业务价值,交易和生态分成买入口位置。

为什么 LLM 改变商业模式

传统软件的边际成本接近于零,最自然的收费单位是 seat、版本、功能模块和组织规模。LLM 产品不同:每一次调用都真实消耗推理算力,成本会随着上下文长度、输出长度、模型强度、模态、工具调用、实时性和并发规模变化。

这意味着 AI 产品必须同时解决两个问题:

  • 用户需要一个简单、可预期的购买感受。
  • 厂商需要一个能覆盖高强度推理成本的单位经济模型。

因此,LLM 商业化会天然变成混合模型:前台用订阅、会员、额度、任务包、成果包让用户理解;后台用 token、cached input、GPU time、workflow execution、resolution、transaction、capacity unit 来对齐真实成本。

商业模式谱系

下表的代表案例是 2026-06-09 的公开资料快照,长期价值在模式分类,不在具体价格或套餐名。

模式典型计费单位代表案例适合场景核心风险
API 用量计费input token、cached input、output token、tool call、音频分钟、视频秒OpenAI、Anthropic、Gemini开发者 API、RAG、后台生成、批处理用户难以预估账单
缓存计费cache write、cache read、cache storageAnthropic prompt caching、Gemini context caching、OpenAI cached input长上下文、Agent 循环、代码库、文档库prompt 结构变化会破坏缓存收益
延迟与容量计费Batch、Flex、Priority、Scale Tier、PTU、reserved capacityOpenAI Scale Tier、Azure Provisioned Throughput生产级 Agent、客服、搜索、实时交互容量预购利用率不足
消费订阅月费、消息量、模型等级、上下文窗口、记忆、广告或无广告权益ChatGPT Go/Plus/Pro、Claude Pro/Max、Character.AI c.ai+高频个人使用、陪伴、生产力重度用户亏损,轻度用户补贴
Credits / Points 钱包AI credits、compute points、生成 credits、美元余额GitHub Copilot、Poe、OpenRouter、Runway、Inworld多模型、多模态、高成本能力点数黑箱化,用户不懂单价
Agent 行动 / 成果计费resolution、automated resolution、conversation、action、workflow executionIntercom Fin、Zendesk、Salesforce Agentforce、Microsoft Copilot PAYG、Zapier Agents客服、销售、办公自动化、IT 流程成果定义和归因争议
交易与广告CPM、CPC、转化抽成、Instant Checkout、商家接入ChatGPT Ads、OpenAI + Instacart、AI shopping搜索、导购、本地服务、电商信任、排序公平、广告和答案边界
BYOK / 路由自带 API key、路由费、平台抽成、fallback 成功运行OpenRouter、Convai Connect、Inworld BYOK高级用户、企业合规、多供应商冗余支持责任、密钥安全、质量不稳定
创作者生态市场抽成、订阅分成、收益池、资产销售Roblox、Fortnite Creator Economy、Fab、ElevenLabs Voice LibraryUGC、虚拟角色、AI 工具包刷量、IP、审核、收益分配争议

关键趋势

1. “无限使用”会越来越少

早期 AI 产品喜欢用固定订阅换取增长,但重度用户会把推理成本放大到不可持续。GitHub Copilot 从 premium requests 走向 AI Credits,Runway 调整 Unlimited 到 Max,Poe 用 points 区分模型成本,本质都在做同一件事:保留订阅入口,但把高成本行为重新放回额度系统。

未来的消费级 AI 很可能保留“看起来很简单”的套餐,但套餐背后通常需要额度、限速、队列、模型降级、缓存和公平使用策略。

2. Credits 会成为用户可理解的“算力货币”

Token 是工程单位,不是用户单位。用户很难理解 input token、output token、cache read、tool call 的差异。Credits / Points 的价值在于把复杂成本折算成一个内部货币。

这对多模态产品尤其重要。Runway 可以按视频秒扣 credits,ElevenLabs 可以按字符或分钟计费,Poe 可以让不同模型消耗不同 points,GitHub Copilot 可以把一次小问题和一次长 Agent 任务放进同一个 AI Credits 框架。

Credits 的问题是透明度。用户不一定知道为什么某次任务扣得多,失败生成是否应该扣费,重试是否消耗额度。额度系统如果解释不清,会很快变成账单焦虑。

3. 缓存会从工程优化变成商业能力

长上下文和 Agent 循环是 LLM 产品的核心体验,也是成本黑洞。prompt caching、cached input、context caching 的意义不只是省钱,而是让“长期记忆、项目上下文、世界状态、角色设定、代码库理解”这些能力有了可持续的成本结构。

谁能把稳定上下文设计成高命中缓存,谁就能在同等价格下提供更长记忆、更强连续性和更低延迟。对产品设计来说,缓存不是后端细节,而是未来 AI 产品的商业护城河之一。

4. 低延迟和稳定容量会成为高级权益

实时语音、Agent 操作、客服、代码助手、游戏 runtime 都不能只看 token 单价。它们还需要低延迟、稳定吞吐、峰值容量和失败兜底。

因此,Batch/Flex 适合离线任务,Priority/Scale/Reserved Capacity 适合生产任务。用户买的不只是“更聪明的模型”,还包括“现在就回答”“不要排队”“高峰期仍然可用”“Agent 任务不要半路断掉”。

5. Outcome pricing 会扩展,但不会适合所有产品

Intercom Fin 按 outcome 收费,Zendesk 用 automated resolution,Salesforce 和 Microsoft 把 Agent 行动拆成 credits 或 conversation。这背后的判断是:企业客户不想为 token 买单,只想为结果买单。

但 outcome pricing 的前提很苛刻:结果必须可定义、可验证、可防作弊、可归因。客服里的“解决一个问题”相对清楚,创作、游戏、陪伴、开放式探索里的“结果”就很难定义。

6. AI 入口会走向交易和广告

当 LLM 不再只是回答问题,而是帮用户比较、选择、下单、预约、执行任务,它就会成为新的商业入口。ChatGPT Ads、AI shopping、Instant Checkout、Agentic Commerce Protocol 指向同一个方向:AI 不只卖算力,也卖分发、信任和转化。

这条路的风险同样明显。LLM 的价值来自用户相信它是在帮自己判断。如果广告、商家排序或赞助内容污染答案,入口型商业化会反噬产品信任。

产品设计启发

先区分三种价值

LLM 产品至少有三种价值,应该对应不同商业化方式:

  • 基础可用性:回答、生成、总结、常规对话,适合订阅或免费层。
  • 高成本能力:长上下文、强推理、语音、视频、实时 Agent、多轮工具调用,适合 credits、额度、队列和高级订阅。
  • 可验证业务结果:客服解决、销售转化、流程完成、交易达成,适合 outcome、transaction 或 revenue share。

混淆这三种价值会带来两个坏结果:要么定价太低导致成本失控,要么把用户本来以为属于核心体验的能力拆成小额收费,破坏信任。

让用户买“体验单位”,不要买“工程单位”

用户可以理解:

  • 一次深度研究
  • 一个视频生成任务
  • 一次自动化流程
  • 一次客户问题解决
  • 一个月更长记忆
  • 一个创作者工具包
  • 一个高优先级队列

用户不容易理解:

  • 多少 input token
  • 多少 output token
  • cache write 是否命中
  • 几次 tool call
  • 模型 fallback 是否收费

好的 LLM 商业化应该把工程单位留在后台,把用户单位设计成可感知的体验单位。

免费层必须用 cheap path 支撑

免费层可以扩大入口,但不应该依赖最贵模型无限开放。更合理的结构是:

  • 常规任务走小模型、本地模型、缓存、模板或低优先级队列。
  • 高成本任务用次数、额度、排队或降级保护。
  • 让用户明确知道升级后获得的是更长上下文、更稳定容量、更快响应、更高质量,而不是“免费层被故意做差”。

成本透明要比单价便宜更重要

AI 产品的用户不只怕贵,也怕不可预测。Copilot、Runway、Poe、Gemini API 等产品的用户讨论里,反复出现的问题不是“每单位多少钱”,而是“我不知道为什么用了这么多”“为什么失败也扣”“为什么同样任务这次更贵”。

因此,AI 产品需要成本仪表盘:按功能、模型、任务、项目、用户、失败重试、缓存命中拆分成本,让用户和开发者都能调优行为。

对 AI 原生游戏的启发

AI 原生游戏的商业化会比普通 AI 工具更难,因为玩家并不是来管理账单的。玩家来到游戏里,是为了沉浸、扮演、冒险和情绪回报。

如果游戏把 runtime LLM 的真实成本直接裸露给玩家,比如“和 NPC 多聊一句就扣真钱额度”“AI 伙伴每次推理都消耗付费点数”,玩家会从角色扮演状态掉回账单管理状态。

更适合游戏的做法是:

  • 核心体验由买断、订阅、季票或内容包覆盖。
  • 高成本 AI 能力放进创作者工具、实验室模式、异步生成、回放生成、UGC 制作等外围层。
  • 游戏内资源可以模拟 AI 成本,但不要和真钱一一绑定。
  • 付费不应购买更聪明的伙伴、更强解法或更容易胜利。
  • 创作者生态可以成为长期商业化方向,但必须先解决审核、IP、声音、人格和收益分配。

这也是 TokenPunk_产品形态和商业化方案 的核心前提:LLM runtime 是卖点,但不能把玩家的 AI 共犯变成付费外挂,也不能把作品对 Token 压迫的批判变成现实账单压力。

风险清单

  • 账单冲击:用户低估长上下文、语音、视频、Agent loop 的成本。
  • 无限承诺不可持续:重度用户会消耗远超订阅收入的推理资源。
  • 点数黑箱:credits 简化了购买,但也隐藏了真实单价和失败成本。
  • 质量和成本错配:高价模型不一定总能带来可感知价值。
  • 延迟被低估:实时产品需要买容量,不只是买 token。
  • 广告破坏信任:AI 的回答独立性比传统信息流广告更敏感。
  • BYOK 责任模糊:平台、模型供应商和用户之间的质量、安全、限流责任难分。
  • 训练数据与隐私:用户提示词、输出、项目上下文和行为轨迹都可能成为敏感资产。
  • 创作者生态治理:AI 角色、声音、任务、资产市场会带来 IP、人格、未成年人和审核问题。

可复用判断

  1. AI 产品不应只问“怎么收费”,而要先问“哪一部分成本随使用线性增长,哪一部分价值可被用户感知”。
  2. 用户可以买额度,但不应该被迫理解 token。
  3. 缓存、路由、降级、批处理和队列是商业模式的一部分,不只是技术优化。
  4. 如果结果不可定义,不要急着做 outcome pricing。
  5. 实时 LLM 产品必须先证明单位经济模型,再承诺大规模在线体验。
  6. 对消费产品来说,广告和交易是第二曲线,但信任是第一资产。
  7. 对游戏来说,现实付费最好购买内容、表达、创作和便利,不要购买系统优势。

延伸资料

这里不保留大量价格页。具体价格和套餐会持续变化,长期有价值的是它们背后的计费单位、容量逻辑和入口商业化方向。