跳到正文
热点事件持续更新

Ai2 分享 GPU 集群调度系统改造实践

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维转为透明的预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300,规模 88 至 1024 GPU,服务约 150 名内部研究员,需求常年是可用算力的 2-3 倍。旧调度器曾导致 GPU 占坑和优先级通胀,最终 100% 工作负载都标为 HIGH。 新系统中,用户可将最低运行时间设为零,表示 GPU 时间不分配,这类工作负载总会被抢占,但不计入任何预算;时间切片下,受保护的运行时间上限为 8 小时,超过分配后会话可被抢占。Ai2 还计划在本地存储旁建设 CPU 专用集群用于数据准备开发会话,并为这些 CPU 工作负载构建可恢复会话。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Hugging Face Blog
    Ai2 如何用 GPU 时间预算与分层公平分配改造集群调度

    Ai2 用 GPU 时间预算、分层公平分配和时间切片契约替换了原有的优先级调度器,把各研究项目该分多少 GPU 时间的争论从逐案运维转为透明的预算流程。其集群管理数千块 NVIDIA H100、B200 和 B300,规模 88 至 1024 GPU,服务约 150 名内部研究员,需求常年是可用算力的 2-3 倍。旧调度器曾导致 GPU 占坑和优先级通胀,最终 100% 工作负载都标为 HIGH。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。