[모델]알레프 알파, 78B 오픈 MoE 모델 '콜리브리' 공개
독일 AI 기업 알레프 알파(Aleph Alpha)가 오픈 가중치 MoE 모델 '콜리브리(Kolibri)'를 공개했습니다. 총 78.1B 매개변수 중 토큰당 3.46B만 활성화되며, 100만(1M) 토큰의 컨텍스트 길이를 지원합니다. Apache 2.0 라이선스로 배포되어 상업적 활용도 자유롭습니다.
전문 읽기접기
무슨 일이야
알레프 알파가 영어와 독일어를 지원하는 오픈 가중치 MoE 모델 콜리브리를 출시했습니다. 이 모델은 전체 78.1B 파라미터 규모이지만, 실제 토큰을 처리할 때 활성화되는 파라미터는 3.46B에 불과합니다.
또한 최대 1M 토큰이라는 긴 컨텍스트 윈도우를 제공하며, 요청 단위로 추론 노력(reasoning effort)을 조절할 수 있는 기능을 갖췄습니다. 모델 가중치는 Apache 2.0 라이선스로 풀렸으며, FP8 버전을 사용할 경우 단일 B200 또는 H200 GPU 1장에서도 구동이 가능합니다.
왜 중요해
70B급의 성능 잠재력을 가지면서도 실제 추론 시에는 3B급의 연산량만 쓰기 때문에 서빙 비용을 크게 낮출 수 있습니다. 특히 1M 토큰의 장문 처리와 요청별 추론 조절 기능까지 갖춰, 단일 고성능 가속기(H200, B200) 환경에서 효율적인 대규모 문서 처리 파이프라인을 구축하려는 개발자들에게 매력적인 선택지가 될 것으로 보입니다.
짚고 넘어갈 점
원문 기준으로 구체적인 벤치마크 점수나 기존 오픈소스 모델들과의 정량적 비교 데이터는 언급되지 않았습니다. 영어와 독일어에 특화된 모델인 만큼, 한국어를 비롯한 다국어 작업에서의 성능은 직접 검증이 필요해 보입니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.