← 陆家贤 ← Jiaxian Lu

Token 经济:稳定接口如何解耦 AI 技术栈 The Token Economy: How Stable Interfaces Decouple the AI Stack

Chinese only

以下内容与我的工作无关,仅为个人感想与学习笔记,不代表任何公司或机构的立场。

These notes are unrelated to my work. They are personal reflections and study notes only, and do not represent the views of any company or organization.

本文是对以下内容的阅读笔记:Vipul Ved Prakash 在 X 上的帖子 These are reading notes on: a post on X by Vipul Ved Prakash

摘要

AI 产业正在围绕几类稳定边界形成模块化分工:Transformer 提供共享的模型架构底座,OpenAI 兼容 API 成为事实上的推理服务接口,Harness 将模型输出转化为持续行动,MCP 则为 Agent 连接工具提供开放协议。接口越稳定,各层越容易独立优化、替换和竞争,价值也会从单一模型向推理效率、运行时、工具、数据、分发及算力基础设施迁移。但“开放权重必然商品化一切”仍是作者立场,不是已经完成的产业事实。

一句话判断

AI 技术栈的长期变化,不只是模型越来越强,而是接口稳定后,各层开始从垂直一体化系统中拆出来,形成可以独立竞争的市场。

这一判断借用了 Carliss Baldwin 与 Kim Clark 的模块化理论:稳定接口可以降低组件之间的协调成本,让不同参与者同时改进各自部分。个人电脑产业曾通过处理器、操作系统、外设和软件的解耦实现扩张;作者认为 AI 正经历相似过程。

其机制可以写成:

接口稳定 → 组件可替换 → 专业化分工 → 横向竞争 → 单位成本下降 → 使用量扩大 → 进一步投资与标准化

AI 技术栈正在拆成哪些层

层级 主要对象 关键边界 模块化带来的变化
资本与算力 土地、电力、数据中心、GPU、融资 标准集群和工作负载 算力建设与模型公司逐步分离
模型生产 Transformer、训练与后训练配方 共享架构与工具链 配方和优化更快扩散,开放模型进入门槛下降
推理服务 vLLM、SGLang、云端推理平台 OpenAI 兼容 API 应用可以在不重写上层逻辑的情况下切换模型或供应商
Agent Runtime Harness、状态、记忆、权限、评估 工具调用与任务生命周期 “一次回答”被转化为可恢复、可约束的持续行动
工具与能力 MCP Server、CLI、Skill、业务 API MCP 等开放协议 工具可以被多个 Agent 客户端复用
应用与分发 编程、办公、研究和行业应用 用户工作流 价值从模型能力延伸到数据、体验、流程与业务结果

三类“稳定接口”需要区别对待

1. Transformer:共享工业底座,而非已证明的智能理论

2017 年的《Attention Is All You Need》提出了基于注意力机制的 Transformer,并展示了其并行训练优势。此后它成为大语言模型的主流架构,共享优化可以在模型、训练框架和硬件之间快速扩散。

但原文把 Transformer 称为“极具普适性的智能理论”,属于作者的哲学判断。更稳妥的说法是:Transformer 是当前广泛复用的工程底座,并不等于关于智能本质的定论。 状态空间模型、混合架构和新的注意力变体仍在持续发展。

2. OpenAI 兼容 API:事实接口,而非中立标准

vLLM 等推理引擎公开提供 OpenAI 兼容服务,应用只需替换 base_url 和模型名称即可接入其他模型。这说明 Chat Completions、Responses 等接口已经产生显著的生态兼容性。

它更像事实标准:由市场采用形成,但仍由原始供应商的产品演进影响。不同实现支持的字段、工具调用语义和错误行为可能不完全一致,因此“兼容”不等于可以无测试替换。

3. Harness 与 MCP:架构模式和开放协议不是一回事

Harness 负责把模型放进“行动—观察—纠错”的循环,并补上状态、重试、权限、沙箱、预算和评估。它是正在收敛的工程模式,还不存在一个统一的 Harness 接口。

MCP 则是更明确的标准化边界:它定义 Agent 如何连接工具、数据和应用,并已进入 Linux Foundation 旗下 Agentic AI Foundation 的中立治理。可以概括为:

Harness 决定 Agent 怎样行动,MCP 约定 Agent 怎样接入外部能力。

为什么稳定接口会推动开放权重

开放权重模型可以复用共同的架构、训练框架、推理引擎和芯片路线,不必重新发明完整技术栈。单个实验室公开的新结构、训练技巧或系统优化,也更容易扩散到其他参与者。

由此可以推出一个较强但合理的趋势判断:

  1. 通用工作负载会逐渐出现多个“足够好”的模型;
  2. 应用通过兼容接口和路由层在模型之间切换;
  3. 同质工作负载上的供应商溢价受到压缩;
  4. 闭源前沿模型继续在高难度、可靠性或独特能力上收取溢价;
  5. 差异化价值向数据、分发、工作流、服务质量和专有工具迁移。

商品化发生在具体工作负载,而不是整个模型市场

一个开放模型在某类代码生成任务上达到“足够好”,只会压缩该任务上的价格差,并不意味着它在复杂推理、长程 Agent、合规支持或所有语言场景中都能替代闭源前沿。判断单位应是“特定任务的质量—成本—延迟”,而不是笼统的模型排行榜。

“Token 是基础资源”只是一种经济比喻

Token 可以计量模型输入输出和推理消耗,因此逐渐成为 AI 服务的计价单位与中间投入品。但它还不是严格意义上的同质商品或货币:

  • 不同 tokenizer 下,一个 token 所代表的信息量不同;
  • 不同模型生成的 token 在质量和任务价值上不可直接等价;
  • 输入、输出、缓存和推理 token 的成本结构不同;
  • 真正有意义的指标是单位成功任务成本,而非 token 单价或消耗量本身。

因此,“Token 经济”最有用的理解不是“token 会成为货币”,而是:智能服务开始像云计算一样被计量、路由、采购和优化。

产业价值不会消失,只会向新瓶颈迁移

当模型和推理接口更容易替换,竞争优势会迁向仍然稀缺的部分:

  • 专有数据与高质量反馈;
  • 可验证的任务成功率;
  • 低延迟、高吞吐与稳定服务;
  • 安全、权限、审计和合规能力;
  • 深嵌用户工作流的分发入口;
  • Agent 的状态、记忆与持久化工作空间;
  • 便宜而稳定的电力、芯片和融资能力。

这也是为什么《Agent 文件系统:从一次性沙箱到持久化工作空间》和《Agent Skill 规范、构建与设计模式》所讨论的问题仍然重要:模型可替换之后,长期状态和组织方法反而更接近可积累资产。

作者推演:哪些结论尚未被证明

Vipul Ved Prakash 是 Together AI 的联合创始人兼 CEO;Together AI 的业务直接受益于开放权重模型、独立推理服务和算力市场扩张。因此,文章既有产业洞察,也有明确立场。以下内容应作为作者推演保留:

  • 开放权重是模块化演进的“直接经济后果”;
  • 多数通用工作负载上的闭源模型溢价最终会趋近于零;
  • 开放模型会让 GPU 集群成为更容易融资和证券化的通用资产;
  • Token 经济可能成长为世界最大的经济体之一;
  • 开放生态面临的最大风险不是技术或商业,而是监管俘获。

这些论点构成了一套连贯假说,但结果仍取决于模型差距、监管、安全责任、数据壁垒、供应链和客户转换成本。

待持续验证的数据

原文包含大量快速变化的数字,不适合作为永久结论:

  • Together AI 的月度 token 处理量与增长倍数;
  • 开放模型与闭源模型的即时价格、速度和准确率差距;
  • 各模型公司的 ARR、估值和融资规模;
  • 全球 AI 算力功耗与未来基础设施投资预测;
  • SWE-bench 等基准的当前成绩。

这些数据只能作为文章发表时的市场快照。需要使用时,应回到公司披露、模型定价页、基准原始榜单和融资公告重新核验。

用于产品与架构决策的检查表

评估一层 AI 技术是否正在商品化,可以问:

  • 是否存在多个可替换供应商?
  • 接口是否稳定到足以低成本迁移?
  • 数据、状态和工具能否与模型解耦?
  • 替换后是否仍能保持质量、延迟和安全边界?
  • 价格差是否大于能力差?这种差距出现在哪类任务?
  • 我们真正不可替代的资产在模型、数据、工作流还是分发?
  • 当前指标衡量的是 token 单价,还是单位成功任务成本?

一个稳健的架构策略是:上层围绕开放接口构建,底层保留模型路由和供应商替换能力;只在可验证地提高业务结果时,为前沿能力支付溢价。

作者原话(译)

“Transformer 是智能,API 是语言,代理框架是能动性。”

“标准化将分散的努力转化为复合增长。”

“智能究竟成为公共资源还是咽喉要道,与其说取决于模型能做什么,不如说取决于谁被允许构建它们。”

核实来源