社区讨论 · 政策

算力服务这碗饭,不是谁都能端得稳

瑶瑶选品瑶瑶选品7月26日2026/07/26 60 浏览

2026年的WAIC,满眼都是“AI Infra”的牌子,液冷、交换机、集群软件……连做资源对接的平台都改了口径。看着热闹,但我的直觉告诉我:这一波“卖铲子”的,大部分会倒在沙漠里。

作为一个跨境电商运营,我用AI工具做选品和文案已经两年多。从最初调API调到手抽筋,到现在用一套工具链跑通选品-文案-投放全流程,我切身体会到算力是“隐藏的底牌”,但底牌和筹码是两回事。展馆里那些自称“AI基础设施”的公司,多数只是把旧的硬件生意包装上了新概念,真正的算力服务,从来都是少数人的游戏。

对比:巨头超市 vs. 街头小店

拿两个典型方案对比就能看清格局。

方案A:云厂商的“算力超市”
比如AWS或阿里云的弹性算力服务,用户只需要在控制台点几下,就能拉起一个几十节点的GPU集群。他们提供标准化的API、Kubernetes编排、自动扩缩容,甚至预置了模型训练框架的镜像。

# 假设用AWS CLI创建训练集群
aws sagemaker create-training-job \
  --training-job-name my-model \
  --algorithm-specification TrainingImage=... \
  --resource-config InstanceCount=8,InstanceType=ml.p4d.24xlarge \
  --output-data-config S3OutputPath=s3://my-bucket/output/

这种模式的好处是:开箱即用,按量付费,大规模集群稳定性有保障。坏处是:贵,而且对场景非标的中小企业不友好。

方案B:中小AI Infra公司的“定制厨房”
展馆里那些初创公司,往往提供的是“液冷+交换机+存储+调度软件”一揽子方案,但每家的版本都不同。他们宣称能帮客户省30%成本,但实际部署需要客户自己适配硬件、调网络、优化调度脚本。

# 某个中小公司提供的集群调度配置示例(伪代码)
config = {
  "node_type": "custom_gpu_worker",
  "network_config": {
    "topology": "fat_tree",
    "bandwidth": "400Gbps"
  },
  "storage": "distributed_nfs",
  "scheduler": "slurm_with_custom_plugin"
}

表面上看起来更灵活,但问题在于:大多数客户根本没有能力玩转这种非标方案。到头来,时间成本、运维成本、故障风险全转嫁给了客户。我试用过一家这样的公司,文档写得像天书,出了问题三天才响应,最后我老老实实回到云厂商。

核心壁垒:规模、生态、信任

为什么说算力服务是少数人的游戏?我用三个维度梳理:

  1. 规模效应:GPU集群采购价、数据中心电力成本、运维团队分摊,大厂可以做到比小公司低30%-50%。小公司卖价必须更高,但性能却不一定好。
  2. 生态绑定:云厂商有完整的AI平台(数据集、训练、推理、监控),如SageMaker、Vertex AI。用户一旦用上,迁移成本极高。小公司只能蹭API接口,无法提供完整闭环。
  3. 信任成本:初创公司说“我的集群比阿里云便宜”,但客户会担心它明天还在不在。尤其是企业级客户,数据安全、服务连续性比价格更重要。

[!example] 我自己的经历:去年尝试用一家初创的GPU租赁平台训练商品推荐模型,结果训练到一半机器掉线,模型参数全丢。对方赔了误工费,但我的项目周期延期了两周。从那以后,我只用大厂的算力服务,哪怕贵一点。

谁是真正的“卖铲人”?

展馆里那些“AI Infra”公司,大部分其实是在卖“铲子”的配件——液冷机柜、交换机、机房布线。这些是传统IT基础设施的延伸,不是AI原生的算力服务。真正的“卖铲人”是那些能提供从硬件到调度、从训练到部署、从监控到优化全链条服务的大厂。

不过,也有一个细分赛道可能跑出黑马:垂直场景的专用算力。比如针对自动驾驶的仿真平台,针对医疗影像的推理加速,针对电商的实时推荐集群。这些

原文链接:WAIC挤满“卖铲人”,但算力服务终究是少数人的游戏-钛媒体官方网站

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧