📰 AI뉴스#AI뉴스
[도구]프라임 인텔렉트, 블랙웰 기반 추론 플랫폼 출시
방앗간지기10.03 0
프라임 인텔렉트가 엔비디아 블랙웰 기반의 프론티어 오픈 모델 서빙 플랫폼 '프라임 인퍼런스'를 공개했습니다. 서버리스 및 예약형 서빙 방식을 제공하며, OpenAI 호환 API 형태로 지원됩니다.
전문 읽기접기
무슨 일이야
프라임 인텔렉트(Prime Intellect)가 엔비디아 블랙웰(NVIDIA Blackwell) 하드웨어를 활용하는 오픈 모델 추론 플랫폼 '프라임 인퍼런스(Prime Inference)'를 출시했습니다. 이 서비스는 서버리스와 예약형(Reserved) 서빙 방식을 모두 지원합니다. 기존 파이프라인에 쉽게 붙일 수 있도록 OpenAI 호환 API 규격을 갖췄습니다.
기술적인 서빙 파이프라인 구성도 일부 공개됐습니다. GLM-5.3 모델 배포 환경의 경우 Dynamo, vLLM, 그리고 NVFP4 KV 압축 기술을 조합해 구성했습니다. 이를 통해 프리필(prefill) 그룹당 66개 세션을 처리하며, 유저당 초당 101토큰(101 tok/s)의 생성 속도를 낸다고 밝혔습니다.
왜 중요해
블랙웰 아키텍처와 NVFP4 등 최신 하드웨어 기능 및 압축 기술을 결합해 오픈소스 대형 모델의 서빙 효율을 끌어올린 사례입니다. vLLM 기반 스택에서 높은 동시 처리 세션과 빠른 토큰 생성 속도를 실현하면서, 고성능 오픈 모델을 자체 구축 인프라 없이 서빙하려는 개발자들에게 새로운 선택지가 될 수 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.