TEACHING & TRAINING

把工程现场 带到课堂

以真实设备、真实任务、真实流程为载体,围绕服务器、集群、网络、存储、电力与运维交付,培养实战型工程师。

PHILOSOPHY

怎么教,才能真的会

我们相信工程能力是在真实场景中反复实操训练出来的,不是看视频或背概念就能掌握。

做中学,学中破

先动手,再总结;先遇到问题,再理解原理。把工程现场的真实任务带到课堂,让学员在反复实操中形成肌肉记忆与方法论。

可验证的能力标准

每个能力维度都有清晰的验收标准。学员能不能做出来、做对没有、做得稳不稳,都有客观证据,而不是凭感觉。

工程现场进课堂

训练素材来自一线交付与运维场景:真实设备、真实流程、真实约束。学员在接近产业现场的条件下做判断、动手、排错,而不是在理想化沙箱里走流程。

闭环反馈,持续改进

每个任务结束后回到目标进行复盘:哪里做对、哪里出错、下次怎么改。把单次练习转化为可沉淀的经验,让能力在迭代中稳步提升。

FIVE-STEP METHOD

讲解、演示、实操、任务、复盘,反复循环

把每一次教学拆成五个环节,讲清原理、看懂示范、动手实操、完成任务、回到原点复盘改进。

  1. 01

    讲解

    把要做什么、为什么这么做、关键约束讲清楚,让学员建立预期。

  2. 02

    演示

    老师完整演示一遍,学员看到正确的操作步骤、判断点和常见坑。

  3. 03

    实操

    学员在真实设备上自己做,老师在旁边观察、记录、必要时点拨。

  4. 04

    任务

    给出接近真实项目的小任务,要求学员独立或协作完成,产出可验收的成果。

  5. 05

    复盘

    回到原点对照目标,讨论哪里出错、为什么、下次怎么改,沉淀方法论。

INSTITUTION

大模型本地部署

面向华为昇腾与英伟达等主流算力生态,开展大模型在线、离线部署及运行调试实训,让学员在真实国产与国际化环境中都能完成从硬件适配到模型落地的全链路训练。

  • 华为昇腾生态

    基于昇腾 Atlas 系列与 MindSpore/昇思框架,覆盖模型迁移、CANN 算子适配、Atlas 集群调度与国产算力环境部署,支撑政企与院校信创人才培养。

  • 英伟达生态

    基于 NVIDIA GPU、CUDA、TensorRT 与 NeMo 工具链,覆盖大模型训练推理加速、容器化部署、多机多卡调优,匹配国际化数据中心与云算力场景。

  • 运行调试实训

    围绕模型加载异常、显存溢出、精度对齐、性能瓶颈等真实问题,开展定位、日志分析、调参与回滚演练,培养可上线的工程交付能力。

CORE TRAINING SYSTEMS

七大核心实训体系

从单项操作到跨模块交付。选择方向快速定位,自动轮播展示完整训练内容。

MODULE 01

服务器与AI算力设备

从设备结构、关键部件和管理界面入手,逐步完成服务器安装、配置、系统部署、基础调试和验收,理解 CPU、内存、磁盘、网卡、GPU/NPU 等部件在 AI 工作负载中的作用与协同关系。

  • 服务器架构与主要部件识别
  • 设备拆装、部件更换与 ESD 静电防护
  • 机架安装、上架下架、线缆连接与标签管理
  • BIOS、BMC、固件及带外管理基础
  • RAID 配置、磁盘状态检查与基础恢复思路
  • 操作系统安装、驱动与基础环境配置
  • GPU/AI 服务器架构、设备识别与健康状态检查
  • 设备通电、自检、压力验证与交付前验收
MODULE 02

集群规划、部署与基础调度

从单机能力延伸到多节点系统,理解管理节点、计算节点、存储节点及网络之间的关系,训练节点准备、集群组网、批量部署、资源组织和运行检查等关键能力。

  • 集群架构、节点角色与基础拓扑设计
  • 主机名、地址、时间同步、解析与账号等部署前准备
  • 管理网络、业务网络和存储网络的基础规划
  • 节点批量安装、环境一致性与配置核查
  • 容器、资源编排与任务调度基础认知
  • GPU 资源识别、节点健康检查与基础可用性验证
  • 节点加入、移除、维护、扩容与状态恢复
  • 常见部署失败、节点离线和通信异常排查
MODULE 03

网络规划、配置与性能验证

围绕AI基础设施中设备互联和数据传输需求,建立从地址规划、交换连接到连通性与性能验证的基础能力,理解不同网络平面在系统中的作用。

  • TCP/IP、子网、网关、DNS 与常用网络工具
  • 管理网、业务网、存储网及带外管理网络划分
  • VLAN、链路聚合、冗余链路与基础交换配置
  • 服务器网卡、Bonding/Teaming 与多网口配置
  • 机柜内外综合布线、光电连接与标签规范
  • 连通性、带宽、时延、丢包及基础性能验证
  • 端口、路由、MTU、链路状态等常见问题排查
  • 高速网络及集群互联的基础认知
MODULE 04

存储架构、配置与数据通路

理解本地盘、集中式存储和分布式存储在 AI 场景中的基本作用,训练从容量与性能需求出发完成存储连接、挂载、验证和基础故障排查。

  • 硬盘介质、RAID 级别、容量与性能基础
  • 本地存储、NAS、SAN、对象存储与分布式存储概念
  • 文件、块与对象存储的适用场景
  • NFS、iSCSI 等常见访问方式的基础配置
  • 卷、文件系统、挂载、权限和空间管理
  • 多路径、冗余链路与数据通路基础
  • 容量、吞吐、IOPS、时延等指标的基础理解与验证
  • 磁盘异常、挂载失败、空间不足和性能波动排查
MODULE 05

供配电、机柜与运行安全

AI 服务器功率密度高、运行连续性要求高。教学围绕机房供配电基础、功耗判断、冗余供电与安全操作,帮助学习者理解设备稳定运行所需的电力条件和风险边界。

  • 数据中心供配电链路与基本安全常识
  • 服务器额定功率、峰值功耗与基础负载估算
  • 机柜 PDU、UPS、双路供电及冗余基础
  • 电源模块、供电链路、插座与线缆检查
  • 机柜功率容量、负载分配与过载风险识别
  • 设备上电、下电、断电维护与恢复流程
  • 电力告警、异常掉电及供电故障的初步处置
  • 操作授权、风险确认与现场安全边界
MODULE 06

散热、环境与基础设施监控

从温度、气流、机柜布局和环境告警出发,理解高密度算力设备对散热条件的要求,并建立设备状态、环境指标与告警信息的基础监控意识。

  • 服务器风道、机柜布局与冷热通道基础
  • 温度、湿度、风扇、功耗等关键状态识别
  • 高温、风扇异常、散热不足等风险判断
  • 带外管理、操作系统与监控平台的状态信息关联
  • 告警分级、巡检记录与异常升级处理
  • 设备清洁、环境检查与维护窗口基本要求
MODULE 07

运维、故障排查与工程交付

将设备、系统、网络、存储、电力和环境信息综合起来,训练从现象确认到问题定位、从恢复验证到交付复盘的完整工程思路。

  • 设备状态、日志、告警与运行指标检查
  • 硬件、系统、网络、存储及供电故障的分层定位
  • 故障复现、假设验证、影响判断与恢复确认
  • 巡检、变更、升级、备份与维护窗口基础
  • 现场勘查、实施计划、风险清单与资源准备
  • 安装记录、配置清单、测试报告与验收文档
  • 跨团队协作、问题升级与客户沟通基础
  • 交付复盘、知识沉淀与持续改进

COMPOSITE TASKS

综合工程任务示例

综合任务用于串联多个能力模块,不等同于固定公开课程。具体任务内容、规模与设备条件以当期培养安排为准。

  1. 01 / DEVICE

    设备部署

    完成一台 AI 服务器从设备检查、上架接线、系统安装到基础验收的全过程。

  2. 02 / CLUSTER

    集群组网

    根据任务要求完成多节点地址规划、网络联通、环境准备和集群基础部署。

  3. 03 / NETWORK

    网络配置

    为计算节点配置管理网、业务网和存储网,并验证连通性与基础性能。

  4. 04 / STORAGE

    存储挂载

    完成存储连接、卷或文件系统配置、挂载、权限检查和数据通路验证。

  5. 05 / POWER

    上电检查

    依据设备功耗和机柜条件完成上电前检查、PDU 连接与安全确认。

  6. 06 / DIAGNOSE

    故障排查

    针对节点离线、磁盘告警、网络不通、挂载失败或温度异常开展故障排查。

  7. 07 / DELIVERY

    交付验收

    整理设备清单、配置记录、测试结果、问题清单和交付验收材料。

CAPABILITY MATRIX

七维能力评价模型

评价不止看“记住了什么”,更检验执行过程与可复核的交付结果。

01基础理解
是否理解各基础设施模块的作用及相互关系。
02实操执行
是否能按照任务要求和操作规范完成关键步骤。
03结果验证
是否能使用状态、日志、测试和指标验证实施结果。
04问题处理
是否能分层分析、定位并处理常见异常。
05安全规范
是否具备静电、电力、设备、数据和现场操作安全意识。
06工程协作
是否能够做好计划、记录、沟通、升级和任务交接。
07交付质量
是否能够按验收目标提交完整、可复核的结果与文档。

ASSESSMENT

考核路径

考核不是一考定结果,而是贯穿学习全过程的持续性记录。通过阶段练习、单项验证、综合任务和故障处置,逐步建立可复核的能力证据。

  • 过程性关注学习轨迹与关键节点的表现,而非单次分数。
  • 任务驱动以真实交付物作为评价依据,能做得出来才算掌握。
  • 可视化输出能力画像与改进建议,帮助学员明确短板。
  1. 阶段练习
  2. 单项技能验证
  3. 跨模块综合任务
  4. 故障场景处置
  5. 过程复盘
  6. 能力评价

学院根据学习过程和任务完成情况形成阶段性能力评价,用于帮助学习者识别优势、补足短板,并为后续学习或人才对接提供参考。

NEXT STEP

想了解教学合作或定制课程?

想了解教学合作或定制课程?院校共建、企业内训、政府培训项目,都可联系我们沟通课程内容、师资配备与实训安排。

提交咨询需求 ↗