作者|王兆洋
微信|Geisterspiele
把PPIO的官网丢给一个AIAgent——编程智能体ClaudeCode,或者OpenClaw——它看到的东西和人看到的不一样。
人看到的是图形界面、按钮和控制台,它看到的是一组可以理解、可以调用、也可以验证的能力:今天上线了哪些模型,当前有多少Sandbox可用,账户已经具备哪些授权。只要权限范围明确,它就能直接调用模型。
这家公司为一类不"看"网页的客户,重新做了一个网页。

做这个决定的人是姚欣,互联网从业者对这个名字不陌生——他创办的PPTV曾是中国最大的网络视频平台之一,和BAT缠斗十几年后出售。2018年他二次创业成立PPIO,起家的生意是把分散在各地的闲置服务器聚合成一张分布式算力网络,卖给视频、直播这类要求低时延的行业;2023年大模型爆发,这张网络转向AI推理,长成了今天的三层业务——底层的GPU算力云,中间的模型服务(平台上挂着超百款开源模型,按调用收费),以及去年开始布局的Agent云。
据公开数据显示,截至6月,PPIO日均Token消耗1.2万亿次,在中国的独立AI云服务商中排名第一;所谓独立,指的是刨去阿里、字节这类既有自家大模型、又有自家云的巨头。它在全球有超过66万注册开发者,一个月前刚刚递表港交所。
今年WAIC上,姚欣把公司定位又做了一次升级:从AI云改叫AgenticCloud,智能体云,同时发布两款新品,智能模型网关和AgentHarness。他认为,云的第一客户,正在从人变成Agent。
Token是大模型处理信息的基本单位,也是这门生意的计价单位。自从黄仁勋在今年GTC上把AI数据中心改口叫"Token工厂",这个词就成了行业的总动员令:本届WAIC会场里,从芯片厂、运营商到各家云厂商,几乎人人都在发布自己的Token工厂,万亿级的日消耗量成了新的军备单位。
PPIO也是其中一份子。但和姚欣交流后你会发现,这家Token消耗量极大的公司,它的创始人正在重新思考这场狂热。
1
Token的需求爆发是真实的,也是复杂的
PPIO是个ToB平台,市面上各家模型、各类Agent的真实用量都要过它的后台,行业的冷暖,它比多数公司先感知到。今年Agent的爆发,也直接体现在它后台的数据里。
姚欣把三年来的Token消耗分成三段:2023年人和AI聊天,一个人一天用一万个Token就不错了;DeepSeek带来思考模式之后,模型回答前要先推理,一个问题烧掉十万;今年年初Agent起来,跑一个任务轻松消耗上百万。他自己养的OpenClaw——今年年初爆火的开源智能体,接上微信或飞书,就成了一个能查资料、写文档、跑流程的数字员工——一个月要烧掉两三亿Token,"不是产Token的大户还真用不起了"。
这条陡峭曲线的成色,正是外界今年最大的疑问:年初的Agent热究竟是真需求,还是又一轮虚火。
根据PPIO的观察,2月春节期间消耗突然起量,公司内部以为是AI编程的自然增长;3月单月翻了3倍,才确认是Agent爆发;4月,尝鲜热度退去,OpenClaw的调用量开始下滑;5月,在全球最大的第三方模型调用平台OpenRouter的公开榜单上,另一款主打长期记忆的开源智能体Hermes超过了OpenClaw。此后进入的状态,是每月10%到20%的稳定增长,年化三到四倍。因为平台上每个Token都是企业付费的,这条曲线里少了免费尝鲜的水分。"经过一波尝鲜降温,增速不像之前那样陡峭,但已经进入正循环,变成真正生产力的工具了。"
在PPIO自己公司里,把Agent用得最凶的是财务、人事、行政和市场,反而不是工程师——工程师去年年底就用上了ClaudeCode这类编程工具,但那些工具要命令行、要懂技术逻辑,OpenClaw的门槛低到有飞书就行,办公室白领成了主力。消耗和收入在这里劈了叉:按Token量算,Agent已经超过了人;按创造的收入算,AI编程仍是最大的一块——机器烧便宜的模型,人用贵的。也就是说,一年之内,Token的第一消费者已经从人换成了Agent。
这个变化给Token的生意同时带来了三件事:量在暴涨,单价在下跌,底层的成本反而在涨。这使得这股热潮变得更复杂。
行业喜欢说Token像电,是新时代的水电煤,姚欣不同意。
"Token更像汽油,92号、95号、98号含金量不一样,甚至有的里面给你掺点酒精,发动机就不好用。"
不同模型的Token价差10倍是正常的;同一个问题被重复问到、直接调取算过的结果,价格只有正常的十分之一。而把所有折扣算完,这门生意在全行业范围内是亏的。
公开数据显示,很多大厂的Token业务是负毛利,补贴已经从C端烧到了B端。
而成本这边的故事更拧巴。2023年GPT-4时代,一百万Token六十美金;今天的DeepSeekV4,六块人民币,两三年降了六十倍。姚欣坚持每年10倍的下降还会继续,只是动力来源变了:GPU制程摸到3纳米的物理极限,单卡性能到头,只能靠堆叠横向扩张;而Agent把上下文推到百万级,就要层层落进内存和硬盘,"过去半年最大的变化不是在GPU,是在内存和硬盘"——NAND闪存现货半年接近翻倍,原厂缺货的预期排到了2027年。
所以,量在暴涨、单价在下跌、底层硬件在涨价,这就意味着,只单纯围着“转售”Token做买进卖出的生意,越来越难了。
姚欣把行业玩家分成两类,生产Token的和倒卖Token的——"我们是Token工厂,我们主要生产Token,不是Token中转站。"中转站赚差价,而差价正在被通缩和补贴从两头挤没。要活下来,就得往两头走。往下,把Token的生产真正握在自己手里,成本才有得抠;往上,改变客户付钱的依据——从为Token本身付钱,变成为Token带来的结果付钱。
往上走的这一步,PPIO在这次发布里给出的名字叫"任务成功总成本":不再比谁的百万Token便宜,比谁能用最少的总开销把一件事一次做对。
而且,姚欣认为类似的变化他在视频行业见过一遍:2010年移动视频刚出来,资费贵到看一集要精打细算,后来包月了,再后来没人出门找WiFi了。
Token会走同一条资费消亡史,从大众的账单上消失,沉到产业内部,"以后只有企业侧会关注,个人关心的是养一个智能体要花多少钱"。
1
好马、鞍,和三个臭皮匠
把生产握在手里,同时让客户为结果付钱,这两件事都不是某个单点能做到的。姚欣的做法是全栈。
按黄仁勋的分层说法,AI产业从能源、芯片、算力、模型到Agent和应用分作五层,过去卖算力,把其中一层做便宜就有生意;而客户换成Agent之后,一个任务要在模型、调度、沙箱、记忆之间来回穿梭,服务它的是整条链子串起来的能力。PPIO除能源、芯片之外每一层都自己做——算力云、自研推理引擎、模型服务、沙箱和驾驭工程全部攥在手里。
"只有最懂应用的Infra,才能服务好应用。"姚欣把乔布斯的名言改了个词。AgenticCloud这个新定位就是对这个新体系的描述。
这个选择也跟模型本身的进展有关。过去两年,这个行业解决难题的默认方式是等——等下一代模型。GPT从3到4的那种跃迁养成了一种习惯:什么问题都可以先放一放,反正半年后的新模型会顺手把它碾过去。但今年这个习惯失灵了,GPT5到5.2只剩下一两成的提升,最领先的闭源模型慢下来,开源在身后追近。
"ScalingLaw还存在,只是从模型挪到了模型之外。"姚欣说。智能不再从参数里长出来,就得从别处长。此次的两个重点新品做的就是这件事:智能模型网关把现有模型的智能往更高处推,AgentHarness让智能体能连续工作更长时间。
智能模型网关是最能看出PPIO技术路线的产品。它做两件事:一是调度,router,识别任务类型,简单问答派给便宜的轻量模型,复杂推理才动用旗舰,省的是钱;二是混合,让多个模型交叉组成一个新模型,把输出打碎重组,冲智能上限。他们用小米MiMoV2.5,Kimi2.7和智谱5.2,三个各有偏科的国产开源模型,组成新的模型,性能上得到提高。
“三个臭皮匠,顶个诸葛亮。”他们如此形容这个技术路线。
在一套考察模型完成深度研究任务的基准测试里,智谱单独跑45分,OpenAI最新的GPT5.6拿51分,榜首是Anthropic的旗舰Fable5,55.14分——而三个国产模型的输出打碎重组之后,得分54.55,压过GPT5.6,距离全球第一不到一分,成本只有后者的七分之一。
混合能成立,是因为综合分掩盖了偏科:智谱的编程和Kimi的文本各自是单项冠军,复杂任务要的正是把长板拼起来,拼出来的东西单一模型给不了。
"和华为的韬(τ)定律一样,一块板子不够,叠一块,不行再叠一块。我们把类似的思路搬到了模型上。"姚欣说。单点性能追不上,就用工程和便宜的算力把总量堆上去。
但这种混合不是瞎混,真正的门槛也很高:怎么知道哪个模型真的擅长什么,榜单给不了答案。"打榜讲白了是开卷考试",模型厂商训练时早就拿到了题。它的答案必须来自真实负载——PPIO日均1.2万亿次调用,每一次的成功率、耗时、留存都被记下来,喂给那个专门负责分配任务的调度小模型。1.2万亿除了是产能,某种程度上也是语料,而且只有每一层都自己做的平台才收集得全——单做模型API转卖的平台,看不到任务最后成没成功。
而另一方面,AgentHarness解决的是让智能体撑得更久的问题。姚欣把Harness叫做驾驭工程,模型是那匹马,鞍具决定它能不能被驾驭着跑长途。大模型千分之一的幻觉率,在单次问答里近乎完美,放进一个要连续调用一百次的任务里,出错就从万一变成必然。任务越长,错误的复利越狠,鞍具也就越值钱:沙箱——隔离的执行环境,Agent的代码出了错,炸掉的是沙箱而非用户的电脑——加上工具调用、记忆管理、验证评估,全装在模型外面,全为了同一个目标,让它跑得久。再往前一步是Loop,让AI自己发现问题、自己修复,人不再进去点那个确认键。
这两个部分仍有巨大提升空间,因此姚欣预判下半年Agent还会有一波冲高:驾驭工程越成熟,单个任务消耗的Token就有10到100倍的提升,"哪怕用户数不增长,使用量也会提升10倍以上"。下一波增长要靠任务变得更深,而不是用户变得更多。
1
终究要把账算对
这些技术选择的背后,是PPIO一套自己的算账方式。仔细想想他的很多判断,起点其实是同一句话:"ToC存在尝鲜,ToB最多一两个月尝鲜,之后要付这么多钱,大家都是算过账的。"顺着这个朴素思考往下,他陆续给出了一些和行业主流不太一样的观点。不一样的地方主要在三处:成本、需求,和定价的锚。
主流的算账方式还是从互联网搬来的:报消耗量、报注册数、报占有率,用补贴把数字冲上去,默认规模迟早会自动变成钱——这套打法在团购、打车、外卖上验证过三轮,大厂如今原样用在了Token上,C端补完补B端。

但姚欣不认这套账,理由藏在他平台的后台数据里:企业开发者平均要用10到15款模型开发一个应用,每两三个月就换一批,因为模型迭代太快,没人敢绑死在一家平台上。没有锁定,就没有网络效应;补贴买来的万亿消耗,留不下来。负毛利的万亿和正毛利的万亿,在他的账本上是两种东西——"大厂只讲占有率、只讲Token消耗量,从来不讲自己的毛利率如何。"
他自己的账法更像制造业。"Token工厂"这个词除了是一种比喻,也可以变成某种"会计准则",算的就是一间真工厂的账。
比如,套用电价:中国东西部电价差3倍,算力中心放在哪是第一层。
再套用稼动率:全行业GPU的24小时平均利用率只有百分之四五十,因为人白天用AI、凌晨睡觉,PPIO把凌晨的闲置算力卖到地球另一面,做成"全球版东数西算",把利用率拉到75%。
工艺:自研的推理加速,在主流开源模型上比基准版本快百分之七八十。
最后是用途分层:同样的Token,用来跑Agent长任务还是回答一句闲聊,价值差10倍。
毛利从这几层里一层一层出来。在一个单价每年跌10倍的通缩行业里,这几乎是唯一可持续的利润来源——你和行业平均效率之间的差。囤到最好的卡不构成护城河,做出来效率差才行。这几笔账,单做模型API转卖的公司一笔都算不了,每一笔都得先把生产环节握在手里。
对真需求的判断,也跟着账本走。硅谷和国内大厂三四月份鼓励员工敞开用AI、不设额度,用完发现评估不出产效提升了多少,现在开始限制配额——姚欣形容这是运动式的用法,量不出真实价值。他更喜欢盯小微企业,甚至是OPC——一人公司。
已经出现很多一个人指挥一堆Agent干活,月消耗能达到100亿Token,超过传统大企业;他发现这类公司的人机比普遍在1:10到1:20,PPIO自己才1:3;创业的顺序也倒了过来,从先融资再启动,变成先买个Token包做出Demo、跑通了再去融天使轮。他认为这些愿意自掏腰包烧Token的人越精明,这个信号就越可靠。
另外,出海同样是一笔价差账:海外Token均价比国内高30%,PPIO的海外定价只有AWS和GoogleCloud的约一半,即便如此还是比国内贵三成。如今它70%的消耗来自海外。
把这些账目连起来,能看到姚欣真正在做的一件事,就是换定价锚。
Token按成本计价,锚就在算力上,而算力效率每年都在改善,所以Token的宿命就是每年跌10倍——谁的收入绑在Token单价上,谁就在跟通缩赛跑,跑赢的唯一方式是量涨得比价跌得快,永无宁日。
但如果可以把计价的问题换成"养一个数字员工要花多少钱"呢?这个价格的参照物是人的工资,是它替代掉的那部分人力成本,而人力成本不通缩。从卖Token,到卖任务成功总成本,再到卖数字员工,每往上走一层,定价就离算力远一步、离人的价值近一步。
所以,再回头整体来看它提出的问题AgenticCloud,在商业上的这层变化可能更重要:它有机会把生意的衡量尺度从通缩的Token,挪到不通缩的真实价值上。
而只有这样,AGI许诺的大好前途才可能真的到来。

点个“爱心”,再走吧
本文内容由互联网用户自发贡献,该文观点仅代表作者本人。如发现本站有涉嫌抄袭侵权/违法违规的内容,请发送邮件至 203304862@qq.com
本文链接:https://www.jinnalai.com/jiaodian/847156.html
