LongCut logo

Token经济学:AI时代的新货币战争

By 硅谷101

Summary

Topics Covered

  • Token-maxxing:硅谷新炫富方式
  • 越贵模型反而可能更省钱
  • 中国模型凭1/17价格碾压Claude
  • Token套利:智能路由的中间层生意
  • Token出海:不出境的电力出口

Full Transcript

在我所在的硅谷 有了一种新的炫富方式 每天烧了多少token 这个炫富方式 有个新词 叫Token-maxxing 意思是“把token用量拉到极限” 它变成了公司内外人们攀比的新方式 你每天消耗多少token 你能同时调度多少个agent运行 你的token throughput(吞吐量)有多高 这些正在变成衡量一个人 “有多AI原生”的新指标 在全球AI圈的巨头们

目前正在对此进行一场激烈的辩论 公司应该不设限制地鼓励员工们 去使用token吗 那位50万年薪的工程师 年底的时候我会问他 你今年花了多少token 如果那人说只花了5000块的话 我会大发雷霆 订阅的token没用完我会很焦虑 我们token还花的不够 而在这场辩论的身后 是一场围绕token展开的新军备竞赛

硅谷大厂们为什么在疯狂地卷token用量 这背后到底有没有道理 大模型公司是怎么给token定价的 中国模型如何凭借着“物美价廉” 杀入全球开发者市场 在OpenRouter(开放路由)上霸榜 “Token套利”的新模式 是怎么来赚差价的 以及在这所有的背后 一个更大的问题 中国的token出海 会不会成为下一个结构性的产业机会 如果上一个时代中国出口的是衬衫

这个时代是电动车 那么下一个时代会是token吗 Hello 大家好 欢迎来到《硅谷101》 我是陈茜 这期视频让我们来聊聊 AI时代的新货币战争 Token经济学 4月初 Meta被爆 内部有一个名为 “Claudeonomics”的排行榜 这个排行榜汇集了超过85000名 Meta员工的AI使用数据 列出了token消耗量最高的

前250名“超级用户” 在最近一个月 排行榜上的总使用量 突破了60万亿token 如果按照Anthropic Opus 4.6的定价 大约每百万token平均15美元 来粗略地换算的话 这些token的价值高达约9亿美元 其中排名第一的那位员工 烧掉的token价值高达数百万美元 这个消息曝光之后

立马在硅谷引发了一场大辩论 AI创业公司Writer的CEO May Habib 直接说这是“生死存亡级别的问题” 她自己公司内部 也有一个token消耗排行榜 而且她明确地告诉员工 她本人就在盯这个数据 她认为如果不全力拥抱AI 就会被淘汰 Uber也很激进 目前Uber的后端系统当中

11%的新代码更新已经由agent完成 而三个月前这个比例还不到1% Uber CTO的原话很直白 他说 我的愿景是 把软件工程转型为agent软件工程 但是反对Token-maxxing的声音同样尖锐 HubSpot的CEO Yamini Rangan 在LinkedIn上面发了一句被广泛转发的话

她说Outcome maxxing大于Token maxxing 意思是 比起疯狂地消耗token 不如看看你产出了什么结果 她的话代表了另一种重要观点 纯粹的token使用量是一个错误的指标 AI软件工程公司 Jellyfish的CEO Andrew Lau说得更直白 你可以一天到晚刷token 但是得到的结果可能完全不是你想要的

这两派是吵得不可开交 但是更多的中间派似乎还是形成了共识 他们认为不充分利用AI的公司 会被竞争对手超越 并且变得过时 在这样的信念之下 哪怕排行榜和激励制度不完美 哪怕一些AI使用最终被证明是浪费的 大厂创始人和高层们也被卷起来了 认为必须要这样做才能够让公司 转型成为更AI-native(AI原生)的公司

自OpenClaw爆火以来 我们看到agent任务烧掉的token量 是直线上升 科技巨头们可以不顾成本地去烧token 但是对于创业公司和个人开发者来说 Token的成本带来的是焦虑 你比如像OpenClaw 可能跑一个稍微复杂一点的任务 几千万的token量 都是非常有可能的

如果你是去跑一个最贵的Claude的模型 你可能让它做一个很小的事情 就要花十几二十刀 真的是有点贵 Uber的CTO在接受采访时透露 公司2026年的AI预算 在开年的几个月内就已经全部用完了 主要是因为工程师们 对Claude Code的使用量暴增 他的原话是 我得重新回去做预算了 因为我以为够用一年的钱 已经没了

硅谷知名投资人Chamath Palihapitiya 最近也公开抱怨说 他投资的一家软件公司 自从团队开始使用AI编程工具之后 运营成本在几个月内翻了三倍多 按照这个趋势 年化AI支出将达到千万美元级别 而他半开玩笑地说了一句 “感谢VC们掏钱为这场AI盛宴买单” 大家可以看到 对于企业来说 特别是软件SaaS行业

AI时代的成本结构跟过去完全不一样了 以前做一个SaaS产品 研发投入是一次性的 用户越多 他的边际成本就会越低 这是一门越卖越赚的生意 但现在 每个用户的每一次操作背后 都有一笔token账单在跑 用户用得越深 功能越智能 你作为产品方 反而要付更多的钱给模型厂商 这个成本不会像传统软件那样

摊薄到接近零 它是跟着用量线性增长的 这也是为什么token正在变成 AI创业公司最核心的“弹药” 也有风投基金开始尝试 直接给被投企业提供token额度 作为投资的一部分 这个逻辑也很简单 对很多AI创业项目来说 他拿到钱之后第一件事就是去买token 那为什么不能直接给token呢

你看 顺着这个逻辑来讲 是不是token正在变成一种新的货币 那么接下来 我们就来讲讲 Token到底是如何定价的 Token的定价是怎么算的 这个问题的答案 远不是一个“单价乘以数量”那么简单 我们以一次最简单的对话交互为例 你的账单上 至少有三种不同价格的token在运转 第一是Input token(输入token)

也就是你发给模型的内容 第二是Cached input token 被缓存的输入token 意思是如果某些prompt、上下文 或者文件内容之前已经被模型系统缓存过 再次调用的时候 这部分token的价格会更便宜 第三是Output token(输出token) 也就是模型生成回答的时候产生的token 研究芯片与Token Efficiency(利用率) 方向的肖志斌

在接受我们《硅谷101》采访的时候就说 平均来说 在对话任务上 这三者的价格大概是 1:0.1:6的水平 如果是chat这种应用 它调用就是比较简单的 你喂给它的input context(输入上下文) 还有你提供给它的上下文 还有你提供给它的文件 这一部分都是作为input(输入) 如果你提供给他的prompt 是在它的cache里面被cache(缓存)

一般这个成本就会 基本上是1/10 就是你input token的那个成本 最后它输出的成本 就output token的那个成本 现在OpenAI基本上是它的6倍 6倍versus(对比)input token的成本 不同公司根据模型的能力 给出的定价是不同的 举个例子 GPT-5的API定价上 Input是每百万token 1.25美元 Cached input是每百万token 0.125美元

Output token是每百万token 10美元 而OpenAI发布的最新模型GPT-5.5 是分了长短上下文两档 长上下文的价格是2倍 短上下文input 是每百万token 5美元 Cached input是每百万token 0.5美元 Output token是每百万token 30美元 如果你直接对比价格的话 是不是觉得 怎么涨价了好几倍

其实不能这么算 这里面有一个特别反直觉的悖论 越贵的模型 可能反而总体成本越低 因为强模型一次就可以做对了 弱模型可能要反复重试 中间如果出错就还需要人工介入 这也是综合成本 也就是说 虽然token价格在涨 但是每个有效结论的成本反而在下降 所以你看

最贵的GPT-5.5-pro和GPT-5.4-pro 短上下文input是每百万token 30美元 Output是每百万token 180美元 长上下文还要再贵一倍 但是如果能力足够强 完成任务足够准确 在一些复杂任务和场景上 反而是能够把开发者的成本价格 给打下来的 特别是在agent场景 因为agent不是一问一答

它会来回调用模型 每一步可能调用不同的工具 工具又会产生新的日志和上下文 返回给agent继续循环调用 Agent loop(循环)又重新再持续调用 所以如果是对于agent来说 这个是比较复杂的 除了这种单次模型调用的 Input和output的token cost(成本) 还有持续地产生日志 还有调用工具的cost(成本)

都是在这里面 实际上是相当复杂的 最终完成这个任务的token数 取决于你这个任务 调用了多少次agent loop(循环) 你可以调用一次 如果质量高的模型 它可能一次就生成了你想要的答案 调用的工具也是合适的 返回工具的output也是你想要的 但如果是你真用了便宜模型 结果它可能花费更多的时间 去做这个iteration(迭代)

来来回回地调用 甚至于中间会出错 所以现在有这么一个悖论 其实越贵的模型 可能对于完成任务的成本是越低的 所以 不同的模型公司能够怎么定价 一方面是由模型的推理成本 以及大模型研发费用来决定的 但是仅仅如此是不够的 更关键的是按模型质量和任务的完成度

首先是推理的成本 这就是最基本的成本 就单次推理的成本 比如说你调用一次模型 第二个是说 你在这个模型里面要摊平 你这个大模型的研发费用 这个也是一部分 最重要的其实是按照模型质量去定价 不同的模型类型 有没有reasoning(推理)的能力 然后你context window(上下文窗口)的 size(大小)

还有你完成任务的次数 比如你能够快速地找到正确的output 很多公司其实是按照推理成本去定价 但这样其实是不可取的 应该要按照模型质量 或者是你对任务的完成度去定价 所以这里面的价值空间是比较大的 这里还有一派玩家 就是像微软Azure 亚马逊AWS

或者国内的阿里云跟火山引擎 这样的云厂商 有的企业是通过这些云厂商去调用模型 他们收到的token账单 就是从云厂商这边给出去的 云厂商对token的收费 与大模型公司的API官方收费 不会相差太多 但有时候云厂商会因为 提供了更多的服务和能力 比如说区域部署、特定数据驻留 企业合规、优先推理、托管能力

以及私有化或者是专用吞吐的这些服务 使得价格更贵 这个时候 你的token账单就是 模型token费用加云服务的封装费 再加企业级的基础设施溢价 大部分的云服务商是怎么计价的 他肯定是要根据当下那个模型 在这一个机器上能够跑出多少token每秒 然后再根据这样的一个性能

反向去回推出它的GPU 本来的cost(成本)是多少 也许再加上一个premium(溢价) 就会变成最终的价格 但有的时候 云厂商也会因为企业折扣 或者需要激进抢占市场 来让价格更便宜 这种情况也是有的 而就在后OpenClaw时期 当硅谷开始卷我们开头说到的 Token-maxxing这件事情的时候

大家发现 这个账单还是很可怕的 于是乎就出现了一个现象 来自中国的开源模型 因为性价比 开始在国际开发者社群中大受欢迎 Kimi的价格 我记得爆出来是可能 input大概是不到55美分 你看它的output的话 大概是2点多 2.6左右的状态 MiniMax 我记得是

受到了OpenClaw官方的推荐 在做setup(设置)的时候 选模型的时候 这个MiniMax后面 会有一个recommended(推荐的)标识 就在这个OpenClaw软件里面 所以我觉得这个也是 相当于给中国模型做了不少的宣传 宣传之后大家可能就试了一下 发现 确实 虽然说它顶级能力可能差一些 但是你很多工作 也不是非要这么高的推理能力

很多时候执行其实反而是需要你 不要想太多 Instruction following(指令遵循) 比较好 做得比较快 最重要的还是便宜 在一些任务上 中美模型的价差可以高达50到70倍 这也解释了为什么 当OpenClaw这类agent工具 让token消耗从万级跳到百万级的时候 全球开发者几乎本能地 转向了中国的便宜模型 OpenClaw爆火之后 因为agent任务

对开源模型调用的需求飙升 已经上市的中国模型厂商们 比如说Zhipu AI和MiniMax 在股价上迎来了疯狂的涨幅 与此同时 2026年3月 掀起了一波集体涨价潮 3月 腾讯云、阿里云和百度智能云 国内三大云厂商接连提高AI算力产品价格 10天之内涨价30%左右

现在我觉得大家看到 开源模型的token消耗量上升 是因为开源模型的能力 已经越过了某一个门槛 比如说智谱或者Kimi模型 实际上在coding(编程)上 最近都有一个比较大的提升 我们也知道coding(编程)这个赛道 算是大模型token消耗最大的赛道之一 当程序员们发现 开源模型可能跟几个月前的 Anthropic模型一样好用

但是价格又极其便宜的时候 他们自然而然就会切换到开源模型 这也是为什么开源模型价格上升了 对于个人开发者和创业公司来说 处理不那么复杂任务的时候 转向开源模型是无可厚非的 比如说我们拿MiniMax M2.5 和Claude Opus 4.6做个直接对比 在SWE-Bench Verified的 软件工程基准测试中

两者得分分别是80.2%和80.8% 说实话 这点差距在实际使用中 几乎是感受不到的 但是打开价格表就完全不同了 MiniMax M2.5的输入价格 是每百万token 0.3美元 Claude Opus 4.6是5美元 同样的活 前者的价格 只有后者的1/17 对于一个每天要跑几千万token的

OpenClaw用户来说 这不是省一杯咖啡钱的问题 而是账单从几百美元 直接降到几十美元的区别 中国模型为什么能够做到那么便宜 国内的大模型 技术层面上它用了MoE(混合专家模型) 非常深度的MoE(混合专家模型) 专家的size(大小)变得越来越小 每一次active(运行)的专家数目也不大

通过这种方法技术上可以节省 第二 也有一个生态的问题 大家通过补贴用户 抢占生态 第三点 有些公司 像中国的某些公司 它其实是云厂商 比如阿里 它自己的成本定价可以比外面计价更低 它有更高的margin(利润率) 去把模型价格打得更低

不同的模型其实给了开发者们不同的选择 比如说复杂的任务 就可以交给更高性能的模型 简单一些或者重复性高的任务 就给便宜一点的模型 这样的混合使用 成为了agent时代的新token模式 黄仁勋在2026的GTC大会上 给出了一个更宏观的token定价框架 他把token分成了五个价格区间 第一是免费层

这一层有着高吞吐\低交互速度的特点 靠广告变现 中级层是每百万token 3美元 高级层每百万token 6美元 高速层每百万token 45美元 到超高速层 每百万token 150美元 黄仁勋的意思很明确 Token不再是一种同质的商品 它的价格应该由交互速度和使用场景决定 就像电力有峰谷电价一样

当然 这些暴增的需求背后 也有一个不容忽视的问题 到底是不是真的需要消耗这么多token 一些业内人士就批评说 当前全球企业AI应用当中 可能有近一半的token没有产生实际价值 道理很简单 Agent不像人类那样知道“够了就停” 它在执行一个任务的过程当中 会反复地读取整个对话历史

重新扫描已经处理过的文件 以及把早就过期的上下文 一遍又一遍地“喂”给模型 让每多跑一轮 这些冗余信息就像滚雪球一样越滚越大 但是真正跟当前任务相关的 可能只占其中的一小部分 怎么才能够让agent少烧冤枉钱 正在成为一个新的技术和商业赛道 而Token Efficiency(Token效率) 成了下个阶段的关键词

其中值得提的一个例子 就是OpenRouter这家公司 OpenRouter这个平台已经成为了 观察全球模型使用趋势的一面镜子 你看到的很多关于中国模型 调用和排名的数据图都出自于这个平台 OpenRouter背后的人很有意思 创始人Alex Atallah的上一个身份 是全球最大NFT交易所 OpenSea的联合创始人兼CTO

2023年 他开始做OpenRouter 这门生意的逻辑其实很简单 市面上模型越来越多 开发者不想每家单独注册、单独充值 单独对接API格式 OpenRouter就做了一个统一的入口 所有模型一个接口搞定 平台从中抽取大约5%的费用 根据The Information报道 A16z在2025年 对OpenRouter领投了4000万美元

当时估值大约5亿美元 而最新一轮融资 已经将估值推至了接近13亿美元 让这门生意真正起飞的 是OpenClaw的爆发 当全球开发者疯狂调用各种模型 来驱动agent工作流的时候 他们需要一个能够快速切换模型的中间层 而OpenRouter恰好就在那里等着 这个时机简直不要抓得太好

Atallah曾将OpenRouter 与他上一次创业做过类比 两次做的都是 把分散的供给整合到一个平台上 他赌的是 供给越分散中间商越值钱 它是加了一层API的调用层 这个API调用层 跟OpenAI的API调用是兼容的 如果你需要做一个任务的话 你可以自动去做不同模型的切换

然后统一API、统一定价 这样对于大部分的用户来说 特别是从0到1的AI初创公司来说 快速上线、快速试错 快速找到匹配的模型 这是最重要的 第二个 它有一些后备 一个model(模型)如果出了问题 或者是latency(延迟)突然很高 或者是它下线了 它可以快速地切换到另外的模型

当然了 OpenRouter也有它的数据局限性 其实很多它的token使用量是统计不到的 刚才讲的从0到1的初创公司 可能会用OpenRouter 但是比如说从1到10 它就会混用OpenRouter跟API调用 如果是这种大厂的话 或者是你的业务非常明确的话 它会直接调用大厂的API Anthropic、OpenAI或者Google的API

所以OpenRouter是 对于token的统计量有一定的指向性 或者有一定的prediction(预测) 但并不是包括所有token的调用量 换句话说 OpenRouter的数据 更像是创业公司 和独立开发者群体的风向标 而不是整个AI行业的全景图 但正是这个群体 对价格最敏感 对新模型最愿意尝鲜、迁移成本也最低

这是构成了中国模型出海的 第一波“自来水”用户 如果token是AI时代的“电” 那么总得有人给这些电去装电表 这件事情听上去不够性感 但是看一眼客户名单就知道它有多重要 OpenAI、NVIDIA、Anthropic、Databricks 全部在用同一家公司的计费系统 这家公司就是Metronome Metronome的创始团队背景 很能够说明问题

两位创始人都出自于Dropbox 在那里亲身经历过 一个让所有SaaS工程师都头疼的事情 就是“改定价” 表面上只是把月费调几块钱 背后却要动一大堆 写死在代码里面的计费逻辑 到了AI时代 这个痛点被放大了几个数量级 收费单位不再是“一个人头一个月多少钱”

而是变成了token数、API调用次数 GPU时长 这些颗粒度极细的指标 而且每个客户的合同条款、折扣结构 和用量阶梯可能都不一样 SaaS的成本其实相对稳定 其实就是服务器成本 甚至都是跟云厂商预先商定好的一个价格 但是token公司确实挺复杂的 跟卡本身的情况有关系

跟电的情况有关系 同时其实还跟请求量有关系 它的峰值有时候会挤到一起 大家有时候也有体感 突然哪怕你已经买了最顶级的套餐 你可能也需要排队 你做的任务不一样 其实对token的消耗成本是完全不同的 Metronome做的事情就是清晰地记住 谁在什么时间调用了什么东西 花了多少token

但是大部分公司自己做这件事做不好 因为“发生了什么”和“该怎么去收费” 这是两套完全不同的逻辑 把它们耦合在一起就会越改越脆弱 Metronome的核心设计 就是把这两件事彻底拆开 工程团队只管上报用量数据 产品和销售团队自己配置价格和合同条款 中间的换算、出账、对账全部自动化

他的做法我觉得也不错 首先他先不考虑计费 我先站在技术的角度 用户跟我API的交互 他到底做了哪些事情 比如说是读还是写 还是模型现在在做思考 还是说命中了缓存 这些不同的事件我先记下来 因为这些事件究竟代表多少成本 这件事情甚至都可能是动态的

所以说我先不把它跟钱或者成本挂钩 记下这个事件流之后 可能再有另外一层 就是这些事件流分别怎么定价 比如说你已经命中缓存的 可能只要一分钱 如果没有命中就要一块钱 第三层就是咱们能接触到的 比如说subscription(订阅制) 是一种计费方式 直接买API是一种 设定limit(限制) 再加超过之后多少是一种 最后可能就是

为了把这些东西卖出去要打折 像Opus 成本是两倍 但用量是四倍 他们自己就说自己在打五折 我看完这四层我觉得非常合乎逻辑 这家公司的发展速度非常快 据公开的报道 Metronome累计融资到了1.28亿美元 今年1月被Stripe收购了 一个做计费基础设施的100人的团队

估值追上了很多做模型的公司 这本身就说明 在Token经济里面 怎么算钱也变得越来越重要 而在这样的一个产业中 “套利”的机会也出现了 我们在视频的前面也说到 现在的开发者们会把不同的模型混着用 复杂任务用Claude、GPT这样的昂贵模型 简单任务用MiniMax、Kimi等 中国的性价比模型 对应的 在Token经济学里面

一种新的商业模式正在浮出水面 业内就叫它Token Arbitrage Token套利 这个有点像什么呢 类比一下 大家在国内买运营商的套餐 我记得我家1千兆的下行带宽 只给配了40兆的上行带宽 但是普通用户其实感受不到 其实在token上也是类似的 用户的体感是什么样的 很有可能全都用便宜模型给他做

和你全都用贵模型给他做 在用户看来区别不大 这个时候其实就有空间了 就是你说的Arbitrage 套利空间 本质上最后买单的是用户 所以只要用户觉得可以 那这个就是可以的 就有点像税务审计师 国外 你自己要报税 可能报出来的税是一年要交1万美金 然后你花了5000美金雇了一个审计师

你只报了比如2000美金的税 他更专业 他懂优化 他优化出来的这部分两边各拿一半 Token Arbitrage(套利) 好好做的生意就是这样 像我们自己 如果设置OpenClaw这种agent 你肯定会有一个便宜模型 可能是国内的大模型 你最高端的可能是用 Anthropic的Sonnet

或者是更好的OpenAI的模型 这里配置的话 包括我们公司做了一个OpenClaw 这种token的auto tuner(自动调优器) 针对不同的任务可以更进一步细分 甚至于用一个模型去决定这个任务 到底它的复杂度是什么 可不可以用一个便宜模型 确实 更进阶的套利方式 不只是“批发转零售”

而是去搭建一个“智能路由器” 用户需求进来之后 先用一个模型去判断任务的复杂程度 简单任务分配给更便宜的模型 只有真正复杂的任务才会给Claude或GPT 对用户来说是黑盒 但是中间商在不断地优化成本结构 作为一个模型提供商 实际上大家可能都会 有自己所谓的“路由模型” 它就是一个小的模型 来判断当下这个任务的难易程度

然后把它assign(分配)给 一个合适的模型 来帮你minimize(最小化)它的成本 这个理论上所有的提供商都应该有 还有一种方式 就是直接通过一个agent产品的方式 比如说我们看到 像Genspark或者Manus这样 我们知道 他们内部也是会对不同的模型能力 有一个认知 这个是基于他们已经有的 Benchmark(基准测试)也好 他们的经验也好 他们会对于不同任务去做一个灵活的分发

我觉得省token是正常的 比如说你先有个用户的定价 你有一个margin(利润率) 但是你一开始的定价 比如说是按照复杂模型的使用量来去定的 比如说30%的margin(利润率) 你先设在那了 之后你再做的一个事情就是 一旦用户已经接受了你这样的价格的时候 你其实是拿便宜的token 在换贵的token给到用户 如果用户感知不出来

用户觉得没有一个体感上的变化 或者是表现上的变化 用户其实还是在付原来高价值的token 我们的嘉宾 知县 也是一个典型的“混合调度”用户 他每天跟AI互动几百次 同时使用Claude、GPT和中国模型 但是给它们分配了完全不同的角色 Opus最强的是它的脑洞 我更愿意把Opus当一个产品经理去对待

它想问题的时候会比较发散 我跟它聊的时候就发现 我有些想法跟它一点就透 说我想做一个这样的事情 它基本上就能顺着我没说的话 脑子里想的一些没说的东西 全都能给我列出来 GPT就稍微nerd(书呆子)一点 有点像我在跟技术负责人讲产品 收到的都是一些challenge(挑战)

Opus适合做设计 天马行空 Codex适合做把关、做review(复盘) 中间的执行其实你只要计划写好了 然后把这个计划分得足够精细 其实你需要的主要是什么 就是有一定的智能 并且要快 然后要便宜 因为这是最耗token的时候 真正往外写代码非常非常好的 因为输出是最贵的 其实在这个场景里

国产的这些模型去做执行 把代码写好 写出来 而agent开发者王浩从工程化实现上 帮我们解释了一下应该怎么去做 从最简单的方式入手 我其实就可以拿一个模型 来去分辨用户的问题 因为用户基本上都是在问问题 那我就拿个简单模型 去detect(检测)用户的模型意图 告诉它一定的metrics(指标)怎么去区分

然后再加上不同的threshold(阈值) 其实就是一个最简单的 Engineering(工程化)方式 我就可以把一些任务最简单给区分掉 到后期的时候 你可能抓到用户的一些数据 你其实就可以通过一些简单的 比如说RL(强化学习)的方式 或者是某一些训练的方式 可以去优化你的这个小的模型 前期来讲 你就只要用prompt方式去抓数据 抓到一定数据的时候 再去fine-tune(微调)一下这个模型 一步一步

它就会更加高效地去把复杂场景 和便捷场景给区分掉 让用户没有办法区分 最终他可以去付高价值token的钱 去用低价值的token 那问题来了 这种“套利”可持续吗 我觉得短期内是有机会的 但是对于单个模型 比如说像Anthropic 其实把这个能力已经内置到 它的coding agent里面了

它最近加了一个Advisor(顾问)模式 这个Advisor模式 就是先用贵的模型去判断一下 到底哪些任务可以用便宜的模型做 哪些用贵的模型做 大模型厂商它自己会把这个东西 内置到它自己的生态里面 但跨模型的调度空间远没有被穷尽 因为每家大模型公司只优化自己的模型

然而 市场上的模型实在是太多了 跨模型的智能调度不会只是短期机会 这个其实是有创业空间的 但它不仅仅是说 针对你模型的定价去做这个事情 这里其实要做很多的 针对任务跟模型的匹配 除了这种任务的精准度 还有模型的throughput(吞吐量) Latency(延迟)的这种判断

还有对于模型质量的判断 和对于任务完成度的判断 而且它现在还只是做了 可能比较初始的API的聚合 同时做了一些pricing(定价策略) 但还没有做到刚才说的 这种模型质量跟任务的匹配 甚至于模型跟硬件的匹配 那意味着latency(延迟) 跟throughput(吞吐量)的匹配 到底谁会赢 我的判断其实是

最会调度token的这种系统会赢 但是这种系统可能也不仅仅是 止步于OpenRouter这种程度 因为很多还有 比如类似于做prompt压缩 很多功能其实都会做到 大模型厂商他会把这个东西 做到他自己的生态系统里面 如果你做通用的调度token系统的话

一定要做得更深 讲到这里 我们可以把视角再拉大一点 你有没有想过 当一个伦敦的程序员 用MiniMax的API跑OpenClaw的时候 物理层面上发生了什么 他的请求从英国出发 穿过海底光缆 落在贵州的数据中心里 GPU开始工作 风扇开始转 电表开始跳

几秒钟之后 结果原路返回 整个过程当中 没有一度电离开过中国的电网 但是这度电的价值 已经通过API账单 以token的形式完成了跨境结算 某种意义上 这是一种全新形态的“出口”对不对 中国过去出口日用品、衬衫、家电 后来是电动车 但这些都是实物 要过海关 Token出海不需要集装箱

甚至不需要任何实体商品离开国境 电力在本地消耗 算力在本地运转 但是创造的价值通过互联网 瞬间交付到了全球任何一个开发者手上 有人把这叫做“电力出海” 虽然电没出去 但是电的价值出去了 那么一个自然的问题就是 中国token能够卖得那么便宜 很多人的第一反应就是电价 这种状态会一直持续下去吗

实际情况还挺复杂的 GMI Cloud创始人Alex在GTC现场 就给了我们一个很直率的判断 他说美国其实不缺电 缺的是运送能力 最后就是你的bottleneck(瓶颈) 还是在能源供给端 实际上美国不缺电 美国缺的是 Distribution power(配电能力) 高压电上面很多电 都是几G的电 你天然气一烧 电就喷出来 问题是distribution(配电)

就是你要传到一个点 这是很多的审批 要建一个变电站等等 从330kV一路降到400V或者800V 这东西事实上是非常冗长的一个过程 光是拿审批你就爆炸了 实际上 中美电力成本的绝对值 差异并不大 中国工业用电在0.4到0.6元/度

美国0.8到1.2元/度 中美两边的工业电价差距 其实没有想象中那么大 真正拉开差距的是基础设施的响应速度 中国可以在西部沙漠里面铺满光伏板 再通过特高压电网 把电送到东部的算力集群 所以从电力的角度来看 美国的token价格 一时半会儿会很难下降很多 同时 Alex认为 从存储等供应链角度来看

Token价格短期内更难下降 去年DDR4就是DRAM 现在是过去10倍(价格) 现在CX7也在缺货 Power supply(电源供应)也在缺货 我看到OpenClaw起来 agent起来 多模态起来 还有coding(编程)起来 刚好是三个完美的风暴 所有的供应链就跟不上这个节奏 最大的挑战还是建足够多的数据中心

这个是最大的挑战 因为这个是物理上的限制 提效当然是非常重要的 我觉得每一个云服务商 都会紧跟整个技术迭代的步伐 去提升它的token的效率 去降低它的延迟 但是最终我们都被限制在了 我们一共有多少数据中心 有多少卡、通了多少电这件事情 当然这还会牵涉到数据跨境

网络延时、隐私安全等合规问题 但是起码我们正在看到 OpenRouter上面的开发者平台出海 还有云平台出海 以及开源模型出海的趋势正在迅速发生 这波出海红利 已经实实在在地反映在了收入上 如今MiniMax海外收入占比超过了七成 月之暗面在Kimi K2.5发布后

短短数周内收入就超过了2025年全年 智谱的模型API收入 也在今年出现了爆发式增长 而token需求的天花板目前根本还看不到 每一个event(事件) 都trigger(触发)了 Token消耗的指数型增长 并且目前我们还没有看到 一个明显的天花板 因为首先我们并不是每一个人 都在用OpenClaw

我们并不是把生活中的每一个 Vertical(垂直方向) 都已经进行了全部的AI化 所以在我看来 整个token的consumption(消费) 还是会继续增长 就像老黄说的 我觉得未来的潜力还是非常大 目前是看不到天花板的 大家想想看 现在大部分人还只是偶尔用用OpenClaw 这样的agent 大部分行业还远远没有被agent渗透 但是趋势已经很清楚了

Token的消耗正在从“人类主动发起” 变成“机器自动运转” 一个程序员手动用AI编程助手 一天可能烧几十万token 但是一旦他配了一个agent 全天候在后台跑 写代码、查资料、跑测试、发部署 消耗量可以直接跳到千万级 当这种使用方式从少数极客 扩散到普通开发者 再扩散到每一个知识工作者

Token的需求增长就是指数级别的增长了 如果用一句话来概括这个趋势 上一个时代中国出口的是衬衫和家电 这个时代是电动车 那么下个时代可能就是token了 回到开头那个问题 Token到底意味着什么 对Meta员工来说 它是排行榜上的勋章 对创业公司来说 它是每个月最大的一笔开支 对于OpenRouter来说 它是抽5%佣金的流水

而对于中国的云厂商来说 它是把电力变成美元的管道 对于黄仁勋来说 token会变成大宗商品 每一个输入和输出都与芯片挂钩 我觉得这是一个正常的发展方向 就像我说的 Token是一种commodity(大宗商品) 任何对于销售commodity(大宗商品)之前 在人类历史上会出现过的销售方式 我们可以预计 都可以在token这件事情上出现 所以最后就是看谁更有创意

谁的市场打得更好 因为最终底层的模型 我觉得只要技术还过硬 它们的acuracy(准确性) 实际上是不会有什么太大区别的 未来 token就会是一种大宗商品 而围绕着这样的大宗商品 人类几千年来发明过的所有商业模式 期货、套利、批发零售、聚合平台 计量计费 都会在token身上重新演一遍

同时 token的定价方式 也可能会发生巨大的变化 比如说业界也正在开始尝试 按“复杂度计费”的 Effort-based Pricing模式 或者按任务完成度计费的 Task-based Pricing模式 这都使得Token Economy的定价方式 在未来有着巨大的进化空间 这就像原油到汽油 再到续航里程 这中间定价的逻辑 也会在token 到任务 到业务结果

这条进化路径上再复现一遍 我们在这个视频里面 看到的每一个概念和公司 从Token-maxxing到Token套利 从OpenRouter到Metronome 本质上都是这个古老逻辑的AI升级版本 唯一不同的是速度 这一切不是在几十年里面慢慢展开的 而是在几个月内迅速发生的 当你看完这期节目的时候 OpenRouter上面

可能又多了一个新模型冲上了榜单 某家云厂商可能又调了一次价 某个开发者可能又发现了一种 新的省token的方法 而这场游戏才刚刚开始 以上就是这期视频的全部内容了 你们的点赞、留言和转发 是支持我们《硅谷101》 做好深度科技和商业内容的最佳动力 我是陈茜 那我们就下期视频再见了 拜

Loading...

Loading video analysis...