|
海量资金即将涌入芯片与数据中心赛道,各家企业持续大手笔投入AI技术自研,几乎所有相关参与方都在想方设法,提升自身投入与收益的可预测性。 市场已经诞生GPU交易平台与合约工具,方便买卖双方锁定算力租赁价格。本周二,芝加哥商业交易所(CME Group)宣布,待监管审批完成后,将于10月推出两份场内GPU期货合约,并披露相关细则。 如今这类金融创新开始瞄准词元(Token)—— 企业调用AI模型时实际付费结算的计量单位。 据报道,初创算力交易平台Compute Exchange原本业务是撮合GPU持有方与短期租用者,现在拓展同类撮合业务,推出词元远期合约(Token forwards)。这属于场外私下协商合约,允许企业最长锁定未来六个月的词元采购价格,对冲后续AI使用成本波动风险。 词元远期合约的定价模式和GPU合约存在区别:GPU合约一般锁定运行AI模型所需算力的小时单价;词元合约则在更长周期内锁定统一价格,交易标的也是企业日常业务真正消耗的资源。 客户可选择六家签约推理服务商提供的多款主流开源权重模型。远期合约和CME筹备的标准化场内期货并不完全等同,但标志着金融市场套保机制,进一步延伸到更多类型AI成本项目。 词元就是送入AI模型、以及模型生成回复时拆分出的文字片段,这个处理流程被称作推理。全球绝大多数AI交互行为发生在推理环节,而非新模型训练。随着智能体承接越来越多AI流量,推理业务规模即将迎来爆发。 德勤预测,到2026年末,推理任务将占到整体AI算力负载的三分之二,2023年这一比例仅为三分之一。 AI应用早期阶段,不少企业放开权限,允许员工不受限制使用AI。Meta等大厂开启了词元最大化风潮:搭建内部排行榜,鼓励员工尽早、高频测试AI,消耗海量词元资源。随后优步、ServiceNow等企业曝出,短短数月就耗尽全年AI预算,各大公司随即出台新规,限制员工AI资源消耗。 AI数据与内存基础设施企业WEKA首席AI官瓦尔・贝尔科维奇表示,任何能够锁定词元采购价格的工具,都有助于各类企业与初创公司更好管控开支。WEKA主要帮助AI系统提升GPU显存利用效率。 “所有人都焦头烂额梳理云账单,”贝尔科维奇称,“登上词元消耗排行榜榜首,从曾经引以为傲的荣誉标签,迅速沦为负面信号。” 他表示,模型规模持续扩大、上下文窗口不断拉长、可自主运行数日乃至数周的智能体落地,叠加新兴网络安全威胁,多重因素共同推高词元消耗量。这使得企业很难掌握完整信息,难以理性制定成本管控方案。 “这个市场过于复杂、透明度不足,需要清算机构来提升信息公开水平。” 在推出词元远期合约的同时,Compute Exchange还将打造标准化词元单位体系,建立一套基准方法,用于对标各类报价方案与模型性能。 Compute Exchange首席执行官李卡门表示,平台的核心价值在于,词元远期合约提供了另一种选择,替代当下主流的AI调用模式——通过通用API接口访问模型。 依靠API调用模式,用户很难管控成本、衡量性能。原因在于模型厂商按照词元用量计费,同时保留调控词元处理速度的权限:例如在不对外告知的情况下调整用户排队优先级、限制调用速率。用户只能被动接受现货价格,无法锁定长期成本,贝尔科维奇将这类市价称作保留价。 贝尔科维奇提到,近几个月词元现货价格波动显著加剧。OpenRouter平台可以直观体现这一变化:以往新上线模型报价能稳定数小时、数日甚至数周,如今价格可能每小时变动。 与Compute Exchange签约的推理服务商,主要运营DeepSeek、月之暗面、阿里巴巴等厂商开发的模型;相比Anthropic、OpenAI等前沿闭源模型,这些方案性价比更高,性能竞争力也持续增强。 有采购需求的企业登录Compute Exchange平台,提交需求清单,包含意向模型、目标价格、吞吐速率与其他指标;平台合作服务商相互竞价争取订单。 一旦撮合成功,词元采购方将知晓供货方信息,并且在合约周期内,有义务消化约定数量的词元。Compute Exchange将抽取4%交易服务费。 不少企业不愿一次性锁定数月固定模型,毕竟几乎每周都有性能更强的新模型问世。李卡门称,平台与合作服务商允许客户在合约框架内切换不同模型。 当然,和所有新兴金融市场一样,词元远期合约发挥作用的前提是拥有足够多买方与卖方。远期合约同时自带交易对手风险:一旦一方无力履约,另一方将承受损失。 但贝尔科维奇认为,对于想要落地AI业务的企业而言,稳定可控的词元定价,或许是在瞬息万变的行业环境中维持经营的关键。 “如果你尝试做预算规划、算力容量规划,只会不断被动追赶波动。” |