用户越多,反而亏得越快:据量子位报道,一款“AI穿搭+购物推荐”应用在新兴市场的ARPU(每名用户带来的平均收入)约为2美元,而每用户云端算力和传输成本达到3美元。每次生成看似不贵,放到亿级日活和每天约3次推理——模型根据输入生成结果——的规模上,GPU闲置与流量费就会被迅速放大。
团队没有整体搬家,而是保留旧云上的主程序和数据库,只把最烧钱的推理层迁往Akamai,再用MultiKueue调度器按集群负载分派任务,流量高峰才启用备用资源。同时,GPU由NVIDIA L4换成RTX PRO 6000。报道援引项目数据称,单张图生成时间从12秒降至3—5秒,所需GPU集群规模缩减75%。
这个案例值得看,但“砍掉四分之三”不能只归功于跨云:硬件更换、调度方式和弹性采购共同起作用。报道也未披露测试周期、完整账单及服务延迟等数据,因此目前更适合作为成本优化案例,而非可直接复制的行业结论。