[연구]Ai2, GPU 클러스터 할당을 '시간 예산제'로 개편
앨런 인공지능 연구소(Ai2)가 GPU 클러스터의 우선순위 기반 스케줄링을 폐지하고 'GPU 시간 예산제'를 도입했습니다. 공유 자원 선점으로 인한 비효율과 우선순위 인플레이션 문제를 해결해 클러스터 가동률과 연구 영향력을 동시에 잡겠다는 취지입니다.
전문 읽기접기
무슨 일이야
Ai2는 H100, B200, B300 등 수천 장 규모의 GPU 클러스터를 운영하며 약 150명의 내부 연구원에게 대규모 분산 학습 환경을 제공하고 있습니다. 하지만 항상 공급 대비 2~3배 수준의 GPU 초과 수요가 발생해 자원 경쟁이 치열했습니다.
기존에는 우선순위 기반 스케줄러와 선점 방지(non-preemptable) 옵션을 사용했으나 부작용이 속출했습니다. 디버깅용 자원을 확보하려고 무의미한 작업을 띄워 자원을 선점하는 일명 '알박기(squatting)'가 나타났고, 시간이 흐르며 모든 작업이 최고 우선순위(HIGH)로 몰리는 '우선순위 인플레이션'이 발생했습니다. 또 선점 불가능한 작업 때문에 장애가 난 노드를 정비할 때마다 엔지니어들이 일일이 작업 중단을 조율해야 했습니다.
Ai2 인프라 팀은 이를 전형적인 '공유지의 비극'으로 진단했습니다. 문제를 해결하기 위해 특정 프로젝트에 고정 하드웨어를 독점 배정하는 방식을 버리고, 계층형 공정 분배(hierarchical fair-share)와 시분할 계약을 결합한 'GPU 시간 예산제'로 전환했습니다. 하드웨어 자체가 아니라 '시간'을 화폐처럼 예산으로 배정하는 방식입니다.
왜 중요해
대규모 분산 학습 클러스터를 운영하는 조직이 겪는 고질적인 자원 분배 갈등을 운영 이슈에서 투명한 행정적 예산 프로세스로 전환했습니다. 경영진이나 리더십이 연구 과제의 가치를 사전에 판단해 GPU 시간을 투자 형태로 배분함으로써, 클러스터 낭비(유휴 시간)를 줄이면서도 전략적으로 중요한 연구에 연산력을 집중할 수 있게 됐습니다.
짚고 넘어갈 점
연구 수요는 실험 결과에 따라 유동적이어서 사전에 정확한 시간 예산을 책정하기 어렵다는 본질적인 한계가 있습니다. 배정된 GPU 시간 예산의 구체적인 소진 규칙이나 세부 정책의 장기적인 운영 효과는 향후 결과를 더 지켜볼 필요가 있어 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.