未来智造局|让推理成本继续下降90%,推动AI“飞轮”转起来——对话无问芯穹夏立雪
从去年12月至今年7月,无问芯穹大模型服务平台单日Token调用量增长40倍,目前公司95%以上的推理任务与智能体(Agent)相关。无问芯穹CEO夏立雪表示,最近一年,公司已经实现了推理成本下降90%,并判断未来仍能进一步下降90%。

新华财经上海8月5日电(记者杜康)人工智能基础设施服务商无问芯穹最新发布的数据显示,从去年12月至今年7月,该平台单日Token(词元)调用量增长40倍,其中95%以上的推理任务与Agent(智能体)相关。
在接受记者采访时,无问芯穹CEO夏立雪表示,智能体的广泛应用正在持续激发推理需求,算力需求侧呈现指数级增长趋势,然而,算力供给仍主要呈线性扩张。两者的缺口正在越来越大。“我们必须从跑马圈地式的粗放发展,走向精耕细作的软硬协同,用极致效率服务更大规模。”
“最近一年,我们已经实现了推理成本下降90%。我们判断未来仍能再下降90%。我们也相信,基础规模与效率相乘,才能真正推动AI在更多真实生产场景中落地。”夏立雪表示。
“前店后厂一中心”,让算力、Token与应用形成飞轮
随着智能体加快落地,AI基础设施建设的焦点从“有没有算力”,逐渐转变为现有算力能否得到充分利用,又能否以行业可承受的成本转化为实际生产力。
夏立雪表示,当前的需求增长已不能简单依靠算力数量堆叠来满足,而需要算法、模型、系统软件和硬件等多层次协同优化。
前不久,无问芯穹提出了“AI生产力公式”:AI生产力 = 智能资源规模 × Token 转化效率 × AI生产力转化效率。
与之对应,无问芯穹提出“前店后厂一中心”的业务体系:以“算力集散中心”触达不同区域、不同代际和不同类型的算力资源,以“Token工厂”提高算力向词元的转化效率,再通过“AI生产力商店”推动词元进入具体行业场景。
夏立雪对记者解释了这套架构的运行模式。关于“算力集散中心”,夏立雪表示,全球算力资源天然呈现地域分散的特点,新建超大规模集群还面临能源供给、建设周期等现实约束。相较于不断建设新的独立集群,通过技术触达不同区域、不同代际和不同芯片类型的存量资源,正成为扩大可利用算力规模的重要路径。目前,无问芯穹已在全国部署触达超 3.7万P算力,覆盖 16 种主流芯片。
“Token工厂”解决的则是资源利用效率问题,核心目标是用更高效进行词元的规模化、高质量生产。
AI生产力商店则进一步进入行业应用环节。与单纯提供算力或模型服务不同,无问芯穹希望以企业级基础设施为支撑,与客户共同优化模型选择、调用方式和资源配置,使词元最终转化为可衡量的业务成果。
夏立雪表示,“前店后厂一中心”并非三个相互独立的业务环节,而是能够形成正向“飞轮”。
行业客户通过“前店”带来真实需求、运行数据和应用反馈,反向推动“后厂”优化模型组合、推理路径和芯片调度;词元生产效率提升、应用成本下降,又会释放更多需求,吸引更多芯片、模型厂商和生态伙伴接入。夏立雪表示,这一“飞轮”使企业竞争力不再仅取决于算力规模或某一项单点技术,而来自算力资源、技术能力、行业需求和生态伙伴之间的持续协同。“技术的持续优化,是公司安身立命的根本。”
推理成本已下降九成,未来还有九成下降空间
推理成本能否持续下降,是AI应用能否从少数示范场景走向大范围落地的关键。
夏立雪给出了一个数字:过去一年,无问芯穹通过模型、系统软件和硬件之间的一系列协同优化,已推动推理成本下降90%。未来仍有进一步下降90%的空间。
以算力集散中心为例,无问芯穹已完成多类跨域算力聚合验证,以扩大可利用算力规模。公司联合中国电信打通新疆哈密与深圳两地的异构算力集群,开展超过4000公里的跨域混合训练,双集群联合训练性能提升165%;在另一项测试中,四个不同代际、不同型号的GPU集群联合训练百亿参数模型,协同训练性能提升41%。
在Token工厂端,如何让不同算力集群各尽所长,是提升推理效率、降低使用成本的另一关键。
记者了解到,大模型推理大致分为两个阶段:先读取并理解用户输入,再逐步生成答案,业内分别称为Prefill和Decode。两个阶段对芯片能力的要求并不相同。
无问芯穹提出跨集群异构PD分离架构,将理解问题和生成答案这两项工作拆开,交给更适合的集群和芯片分别完成,再通过一条高效“管线”无缝协作。让每个集群都去做自己最擅长的事。
实测显示,这套架构可将首个词元时延降低51.5%,同时将单个词元成本降低37.5%。“相当于让‘偏科’的集群各自只做最擅长的题目。”夏立雪说。
在他看来,每个行业都有自身的应用飞轮,而飞轮启动的前提,是AI基础成本下降到行业可以承受的水平。“需要先把规模和效率做到相应的水位,行业才能进一步发展。只有应用真正被使用,才能产生数据和经验,进一步推动模型和基础设施迭代。”
从按量计费到按结果付费,AI服务探索价值分层
随着模型能力、应用场景和用户需求日益丰富,词元也开始呈现更加明显的分层趋势。夏立雪表示,这是一种积极变化。
他表示,词元之间客观存在能力和成本差异,“类似于实体商品面向不同层次的市场,词元经济也会形成面向高端需求和高性价比需求的差异化供给。对于Token工厂而言,重点不在于简单区分词元质量的高低,而在于以尽可能高的效率,生产符合具体场景需求并获得用户认可的词元。”
“需求分层对AI基础设施企业也提出了更高要求。”夏立雪表示,无问芯穹的价值在于,将不同类型的算力资源与多样化需求进行高效匹配,以有限资源尽可能支撑各类需求增长。“这也是我们真正想做的事情。”
“价格分层只是现象,价值分层才是本质。”夏立雪认为,分层不仅体现为不同模型和词元的价格差异,也可以通过不同模型之间的协同实现。针对一项具体任务,系统可以根据不同环节的难度和需求,配置不同模型和算力,最终为客户交付完整成果。
这正是“前店”AI生产力商店探索的方向。相较于按照单一模型或词元调用量提供服务,这种方式更接近围绕最终结果进行优化和付费。目前,无问芯穹已与多个行业客户围绕相关模式展开探索。
从任务分层到开源协同,国产算力加快融入AI生态
夏立雪特别提到,词元和任务的分层,也为国产芯片提供了新的应用空间。
据悉,在无问芯穹已经触达的16种主流芯片中,国产芯片占多数。
夏立雪表示,与一年前相比,国产芯片的应用程度和使用效果已有明显提升。这一变化一方面来自跨集群异构推理等技术优化,另一方面也来自需求侧的变化。
过去,训练任务通常需要大规模、高度一致的芯片集群,对芯片综合性能和集群协同能力要求较高。智能体落地后,复杂任务会被拆解为多个在难度、规模和时延要求上有所不同的子任务,为不同性能和成本结构的芯片提供了更加丰富的应用场景。不同芯片各有侧重,都能在价值金字塔里找到自己的位置,不用浪费资源杀鸡用牛刀。
此外,国产大模型快速迭代和开源生态发展,也为基础设施企业提供了更多优化空间。
夏立雪表示,中国模型厂商普遍支持开源,这对于基础设施企业尤为重要。“开源使基础设施企业能够更加及时地了解模型技术演进,将自身的优化技术应用于模型性能和推理效率提升;相关经验又可以沉淀到Token工厂中,实现基础设施层的能力优化,反过来帮助模型提高运行效率。”
在他看来,这种模型与基础设施之间的双向反馈,有助于形成资源、信息和技术的良性循环,已经构成中国人工智能生态的一项优势。
编辑:林郑宏
声明:新华财经(中国金融信息网)为新华社承建的国家金融信息平台。任何情况下,本平台所发布的信息均不构成投资建议。如有问题,请联系客服:400-6123115













