[모델]TII, 에미리트 방언 특화 LLM 'Falcon-Emirati-7B' 공개
아랍에미리트 TII 연구진이 걸프 지역 방언과 현지 문화 맥락에 특화된 언어 모델 'Falcon-Emirati-7B'를 공개했습니다. 기존 표준 아랍어(MSA) 모델이 놓치기 쉬웠던 일상 구어체, 속담, 나바티(Nabati) 시 같은 고유 문화적 뉘앙스를 재현하는 데 초점을 맞췄습니다. Mamba와 트랜스포머를 결합한 하이브리드 베이스 모델 위에 전용 데이터 파이프라인을 얹어 미세조정했습니다.
전문 읽기접기
무슨 일이야
아랍어는 교과서나 뉴스에 쓰이는 현대 표준 아랍어(MSA)와 실제 일상에서 쓰는 방언 간의 차이가 큽니다. UAE 현지에서 일상 대화, 유머, 협상 등에 쓰이는 에미리트 방언은 고유한 어휘와 운율을 지녀, 일반 MSA 기반 모델로는 단어를 직역해도 실제 함의를 온전히 파악하기 어려웠습니다. 연구진은 이러한 간극을 메우기 위해 에미리트 방언 특화 모델인 'Falcon-Emirati-7B'를 구축했습니다.
이 모델은 SSM(Mamba)과 트랜스포머 어텐션을 블록마다 병렬로 결합한 'Falcon-H1-Arabic' 7B 모델을 기반으로 삼았습니다. 3B는 깊이 있는 문화적 이해를 담기에 용량이 부족하고 34B는 서빙 비용이 비효율적이라고 판단해, 성능과 추론 비용의 균형점인 7B 파라미터를 채택했습니다.
데이터 파이프라인은 세 가지 축으로 구성했습니다. 첫째는 웹과 포럼에서 수집한 실제 에미리트 구어 텍스트, 둘째는 현지 관습과 역사 등 문화적 배경 지식을 담은 MSA 텍스트입니다. 마지막으로 부족한 데이터양을 채우기 위해 자체 어휘 사전과 문법 규칙으로 제어된 고품질 합성(Synthetic) 데이터를 대거 생성해 학습에 활용했습니다.
왜 중요해
다국어 모델이나 표준어 중심 모델이 실제 사용자의 구어체 환경에서 겪는 한계를 극복하는 실질적인 엔지니어링 사례를 보여줍니다. 특히 자원이 상대적으로 부족한 방언을 학습시킬 때, 크롤링 데이터와 문화적 배경 지식, 규칙 기반 합성 데이터를 어떻게 조합해야 하는지 구체적인 튜닝 접근법을 제시했습니다.
짚고 넘어갈 점
원문이 중간에 끊겨 있어 정량적인 벤치마크 점수나 기존 표준 아랍어 모델 대비 성능 향상 폭의 구체적인 수치는 확인할 수 없습니다. 합성 데이터 의존도가 높은 만큼, 실제 복잡한 일상 대화 환경에서 얼마나 환각 없이 자연스럽게 작동하는지는 공개된 모델의 추가 검증을 지켜볼 필요가 있습니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.