← 返回 算力中心 岗位主页

算力中心是干什么的?日常工作内容

这一页只讲算力中心每天具体在做什么:主要职责、常打交道的人、一天大概怎么安排。

技术研发 智算基础设施 IT互联网 不区分

算力中心的日常工作围绕“让算力稳定、高效、安全地供出去”展开。团队要管理成百上千台服务器、GPU/NPU 加速卡、存储阵列和高速网络,确保它们7×24小时不间断运行。具体来说,运维工程师每天要巡检机房温湿度、电力负载和硬件告警,处理设备宕机、网络抖动等突发故障;平台工程师则负责部署和更新算力调度系统,把用户提交的训练或推理任务合理分配到空闲的GPU节点上,并监控任务运行状态,遇到OOM(内存溢出)或卡死就及时干预。

核心职责

  • 监控机房基础设施(供电、制冷、消防)和计算设备的运行指标,设定告警阈值并响应处理。
  • 对GPU/NPU服务器进行日常维护,包括固件升级、驱动安装、硬件故障更换(如损坏的显卡或内存条)。
  • 使用调度平台(如Slurm、Kubernetes)管理算力资源池,处理用户提交的作业排队、优先级调整和资源配额分配。
  • 搭建和维护高速存储系统(如并行文件系统),保障训练数据读写速度,定期清理过期数据。
  • 配合算法团队优化任务运行环境,例如配置容器镜像、调试分布式训练的网络参数。
  • 记录并复盘每次故障,编写运维报告,持续改进监控脚本和自动化处理流程。

典型的一天从早会开始:值班同事交接夜间告警和未完成的任务,然后大家分头处理手上工单——可能是某业务方反馈模型训练速度变慢,需要排查是网络拥塞还是存储瓶颈;也可能是机房空调报警,需要协调物业维修。

下午通常会做资源盘点,看看哪些GPU闲置、哪些用户超额占用,并调整调度策略。每周还会安排一次变更窗口,在业务低峰期升级系统或扩容节点。

算力中心的协作对象很明确:对外是使用算力的算法工程师、数据科学家和业务部门,他们会提交资源申请并反馈使用体验;对内是硬件采购、网络和机房基础设施团队,以及提供云服务的上游供应商。

交付物包括资源使用报告、任务运行日志、故障处理记录和容量规划建议。新人入职前三个月,一般先从熟悉监控面板和告警规则入手,跟着老员工处理简单的硬件告警和作业排队问题;第二个月开始独立操作调度系统,学习分配资源、管理镜像;三个月后能参与一次完整的故障应急演练,并尝试写一个自动化巡检脚本。

下一步:把它变成一次有效投递

了解清楚之后,把简历按 算力中心 的岗位要求改一版,再去看哪些公司在招。

看懂这个岗位之后,下一个问题是「我的简历对得上吗」

知道岗位做什么,和让 HR 从你的简历里看出你能做,是两件事。简历里的经历要按这个岗位的 JD(岗位要求)重新组织关键词,还得先过得了机器筛选。基础功能免费; 秋招冲刺包 ¥499:AI简历姬 1 年会员(简历诊断、JD 匹配优化、AI 模拟面试) + 1 次 1V1 深度语音求职指导 + 1 年微信答疑。

看秋招冲刺包 ¥499 只想先用 AI 工具?看会员方案

用于提升求职方向判断与准备效率,不承诺录用结果;不提供代投服务,不保证内推或 Offer。

内容说明:本页内容按公开资料整理并经人工复核,用于帮助了解岗位,不构成招聘承诺。具体岗位职责和要求,请以用人单位发布的招聘公告为准。