
新手把第一个任务跑上云燧智算机的完整流程
上周帮朋友的实验室搬一个训练任务,卡了一下午。算力没问题,卡点在从通电到能提交任务那段,没人写清楚。交付文档只讲机柜怎么装,不讲你坐到电脑前该点哪。
先说清楚它是什么。它是一整个机柜,计算、存储、网络、供电、散热都在里面,出厂前调过,通电就能用。业内叫 POD,可以理解成一个标准化的算力单元。几个单元横向连起来,就是智算集群。
下面是我走通的顺序。
1. 通电连线。确认供电到位、液冷管路接好、管理网口插上交换机。前面板灯从红转绿,说明自检过了。这步不是你的活,但得盯着,后面连不上管理台,八成是这里的问题。
2. 登录管理台。浏览器输管理 IP,默认账号在交付文档里。进去是总览页,左侧菜单大概分资源、任务、监控三块。第一件事改密码。菜单名各版本有差别,别死记。
3. 建项目、划资源。把卡按团队分到不同项目。我踩的第一个坑在这,图省事把卡全划给一个项目,后面别人要跑就得来找你改。
4. 选镜像。镜像就是一块装好系统和框架的模板盘,省得自己装驱动。重点看框架版本对不对得上你的代码。
5. 挂存储、传数据。数据集传到共享存储,任务里用路径引用。别放容器本地盘。
6. 提交任务。填启动命令、选卡数、选镜像、挂存储路径。状态从排队变成运行中就算成功。排队多久看别人占了多少卡。
7. 看监控。这是我觉得最值的地方。内置故障监测和智能诊断,存储、算力、能效都能看,出故障直接报警。我平时跑量化模型,对利用率这类指标比较敏感,盯三个就够用。
| 指标 | 正常 | 异常先查 |
|---|---|---|
| 算力利用率 | 在稳定区间波动 | 长期偏低,多半卡在数据加载 |
| 功耗 | 随负载起伏 | 满负载功耗不动,任务可能挂了 |
| 温度 | 平稳 | 爬升,先看液冷 |
踩坑单独说三条。一,数据放容器本地盘,任务一重启就没了,一律用共享存储,没有例外。二,环境没验证就上代码,先跑通官方 demo 再换自己的。三,一上来申请最大卡数,先用少量卡把流程跑通再放大,不然排队排到第二天。
优缺点一起说。优点是开箱即用,交付周期短,标准化对运维是真省心,组件化设计能即插即用。官方说法是:
集成高效的智能调度系统,能做到秒级热迁移。
意思是换一块坏卡不用停太久,往上横向扩展的路也铺好了。缺点是标准化的另一面就是自由度有限,想塞非标硬件会很别扭。液冷对机房有要求,不是随便找个房间就能放。热迁移再快,任务本身还得做断点续训,不然迁完还得从头跑。
我的判断是,你要建一个规规矩矩的算力中心,跑标准训练和推理,这套东西的门槛比我预想的低。但如果你的活是试验性质、天天换硬件配置,它未必合适。
先别急着扩卡,把监控面板挂一天,看你任务在稳态下的利用率曲线长什么样。那条曲线比任何跑分都说明问题。
物界前沿