[모델]MS, 판단 특화 모델 'Decision-1' 공개
마이크로소프트가 긴 텍스트 대신 정해진 선택지의 확률만 빠르게 계산해 주는 'Microsoft-Decision-1'을 공개했습니다. 알리바바의 Qwen3.5-9B를 사후 학습시킨 모델로, 라우팅이나 에이전트 제어 등 소프트웨어가 즉시 처리할 수 있는 판단 작업에 특화됐습니다. 현재 Microsoft Foundry와 OpenRouter를 통해 바로 사용할 수 있습니다.
전문 읽기접기
무슨 일이야
마이크로소프트가 텍스트 생성 대신 고정된 선택지별 확률을 계산하는 결정 채점(decision-scoring) 모델 'Microsoft-Decision-1'을 출시했습니다. 이 모델은 상황과 질문, 고정된 선택지가 주어지면 단 한 번의 호출로 각 선택지의 보정된 확률을 JSON 형태로 반환합니다. 장문 작성 기능은 없으며 라우팅, 분류, 검증, 에이전트 제어 등 시스템이 즉각 실행할 판단에 맞춰 설계됐습니다.
기반 모델은 알리바바의 Qwen3.5-9B로, MS의 오픈 데이터 프로세스 하에 공개된 데이터셋과 합성 데이터를 활용해 사후 학습(post-training)했습니다. 36개 벤치마크(147,137개 질문)에서 테스트한 결과 평균 정확도 83.5%를 기록했습니다. 응답 지연 시간은 p50 기준 85ms, p95 기준 125ms로 측정됐습니다.
현재 Microsoft Foundry와 OpenRouter에서 제공되고 있습니다. 기존 채팅 완성(Chat completions) API가 아닌 전용 Decisions API 형태로 동작하며, 가격은 입력 토큰 100만 개당 0.042달러(출력 무료)로 책정됐습니다.
왜 중요해
에이전트 파이프라인이나 백엔드 로직에서 '다음 행동 결정'이나 '분류'만 필요한 경우, 거대한 생성형 LLM을 쓸 필요가 줄어듭니다. 텍스트 생성 과정 없이 확률값만 바로 JSON으로 받아볼 수 있어 시스템 연동이 훨씬 깔끔해집니다.
비용과 속도 측면의 장점도 큽니다. 백만 토큰당 0.042달러 수준의 저렴한 입력 비용과 85ms 수준의 빠른 지연 시간을 제공해, 대규모 트래픽을 처리하는 라우팅 시스템이나 실시간 에이전트 제어의 단가를 크게 낮출 수 있습니다.
짚고 넘어갈 점
벤치마크 지연 시간 측정 방식을 두고 논란의 여지가 있습니다. MS는 자사 모델은 Foundry에서 직접 측정한 반면, 경쟁 모델의 수치는 JevBench v1.6.1 보정 중간값을 인용했습니다. 이에 대해 H2O.ai 측은 해당 벤치마크의 보정 수치가 실제 지연 시간보다 부풀려졌다고 반박하고 있어, 실제 환경에서의 경쟁 모델 대비 성능은 직접 비교 검증해 볼 필요가 있습니다.
참고: MarkTechPost
댓글 0
첫 댓글을 남겨보세요.