开源大模型部署与运行
面向华为昇腾与英伟达等主流算力生态,开展大模型在线、离线部署及运行调试实训。围绕主流开源大模型的本地化部署与推理调优,覆盖权重加载、显存管理、量化压缩、推理加速与多卡并行的工程要点,完成从模型选型、环境准备、服务化部署到性能验证的全链路训练,建立支撑企业私有化大模型落地的基础能力。
TYPICAL ECOSYSTEM
- GLM
- DeepSeek
- Kimi
- Qwen
- gpt-oss
- Gemma
- Llama
- Mistral Large
WHY AI INFRASTRUCTURE
一套 AI 系统从设备进场到稳定运行,需要完成服务器、网络、存储、集群、电力与运维的全链路工程任务。任何一个环节出现问题,都可能影响算力利用率、业务连续性和项目交付质量。
需要规范安装、配置与验收,才能稳定承担训练与推理负载。
需要完成集群组网、部署与资源协同,才能形成可调度的算力池。
需要满足连通性、可靠性和性能要求,否则数据通路成为瓶颈。
需要安全、稳定、可冗余的供配电支持,运行连续性才有保障。
需要持续监控、巡检、维护与优化,异常才能及时发现与处置。
需要标准流程、过程记录和跨团队协作,才能真正落地业务。
THE DELIVERY GAP
用课程学习建立系统认知,用真机实训完成关键动作,用综合任务串联全链路,用能力评价检验学习结果。
TRAINING SYSTEM
理解服务器、网络、存储、集群、电力与运维之间的关系。
按照工程规范完成设备安装、配置、部署、测试和过程记录,养成标准化操作习惯。
在真实设备与任务环境中,针对典型岗位场景反复训练关键操作步骤。
将多个技术模块有机组合为接近真实项目的综合工程任务,训练系统性思维。
通过故障模拟与异常注入,训练观察、判断、验证和恢复的全流程排障能力。
从理解、执行、排障、安全、协作和交付多个维度形成评价。
面向华为昇腾与英伟达等主流算力生态,开展大模型在线、离线部署及运行调试实训。围绕主流开源大模型的本地化部署与推理调优,覆盖权重加载、显存管理、量化压缩、推理加速与多卡并行的工程要点,完成从模型选型、环境准备、服务化部署到性能验证的全链路训练,建立支撑企业私有化大模型落地的基础能力。
TYPICAL ECOSYSTEM
围绕服务器硬件架构、关键部件识别与安装配置,训练设备上架、系统部署、BIOS/BMC 与带外管理、RAID 配置及 GPU/AI 服务器基础,完成从通电自检、压力验证到交付前验收的全流程,建立对 CPU、内存、磁盘、网卡、GPU/NPU 等部件在 AI 工作负载中协同关系的系统认知。
TYPICAL ECOSYSTEM
从单机延伸到多节点系统,理解管理节点、计算节点与存储节点的角色分工,训练节点准备、集群组网、批量部署、容器与任务调度基础、健康检查、扩容维护与常见节点异常排查,建立可承载 AI 训练与推理负载的集群基础能力。
TYPICAL ECOSYSTEM
围绕 AI 基础设施中设备互联与数据传输需求,建立从 IP 规划、VLAN、链路聚合到管理网/业务网/存储网划分的系统能力,完成机柜内外综合布线、连通性/带宽/时延/丢包等性能验证,并训练高速网络与集群互联的基础认知。
TYPICAL ECOSYSTEM
理解本地盘、集中式存储与分布式存储在 AI 场景中的不同作用,从容量与性能需求出发训练存储连接、卷与文件系统、挂载权限、多路径冗余与故障排查,覆盖 NFS、iSCSI 等常见访问方式与吞吐、IOPS、时延等关键指标。
TYPICAL ECOSYSTEM
围绕 AI 服务器高功率密度与运行连续性要求,理解数据中心供配电链路、机柜 PDU、UPS、双路供电与冗余基础,训练功耗估算、负载分配、安全上下电、巡检与电力告警处置,建立操作授权、风险确认与现场安全边界意识。
TYPICAL ECOSYSTEM
从温度、散热、机柜布局与环境告警出发,理解高密度算力设备的散热条件与监控要求,关联带外管理、操作系统与监控平台的状态信息,训练分层定位、变更升级、维护窗口与故障复盘,建立完整的运维排障方法。
TYPICAL ECOSYSTEM
将设备、系统、网络、存储、电力与环境信息综合起来,训练从现场勘查、方案理解、实施计划、风险清单、过程记录到验收测试、文档编制、客户沟通与交付复盘的完整工程闭环,培养可迁移的工程协作与交付能力。
TYPICAL ECOSYSTEM
具体学习内容、实训规模、设备型号与安排,以当期培养计划及正式说明为准。
VERIFIED GROWTH PATH
每个阶段都有明确产出,学习者在退出路径时知道下一步在哪里。
通过初始测评定位学员当前水平、识别强项与短板,建立个性化培养基线。
结合学员背景与岗位诉求,识别适合的学习起点、能力模块与训练重点,规划清晰路径。
围绕服务器、集群、网络、存储、电力与运维,建立AI基础设施全链路系统认知。
在真实设备上完成安装、配置、网络、存储、集群及运维的关键操作训练。
通过跨模块综合任务,训练从需求理解到交付的完整执行与问题处理能力。
通过多维度评价形成阶段性结果,明确优势与待提升环节,输出能力画像。
根据学员实际情况,提供后续学习建议、岗位对接或产业合作资源等持续支持。
INDUSTRY CREDIBILITY
信智海科技集团在ICT与AI基础设施领域有真实的设备、项目与人才积累。
关键操作训练承载在真实服务器、算力设备与配套环境上。
教学涵盖计算、集群、网络、存储、电力和运维交付,不窄化为单机。
由具备工程实践经验的技术人员参与教学、示范和任务设计。
教学、实训、考核和人才发展服务相互衔接,不是孤立课程。
PERSONAL
提供AI基础设施方向认知、能力提升、真机实训与发展支持。
ENTERPRISE
提供岗前训练、在岗提升、人才标准共建、人才推荐与项目协作。
GOV & EDUCATION
提供人才培养项目、课程与实训体系、师资提升和产业协同。