KT, 한국적 AI 담았다…'믿:음 2.0' 오픈소스 공개

한국어·문화 특화…"누구나 상업적 활용"
국내외 벤치마크서 성능 입증
GPT-4 기반 한국형 모델도 순차 공개 예정

KT 제공
KT가 '한국적 AI'의 철학을 담아 자체 개발한 언어모델(LLM) '믿:음 2.0'의 오픈소스를 AI 개발자 플랫폼 허깅페이스(HuggingFace)를 통해 공개할 예정이라고 3일 밝혔다. 기업과 개인, 공공 누구나 상업적으로 활용할 수 있도록 제약 없이 개방된다.

'한국적 AI'는 KT의 AI 철학으로, 한국의 정신과 방식, 지식을 기반으로 구현해 한국에 가장 잘 맞는 AI를 의미한다.

이를 위해 KT는 한국의 사회적 맥락과 같은 무형의 요소와 한국어 고유의 언어적·문화적 특성 등을 충분히 반영해 학습한 AI 모델을 개발해, 대한민국의 산업과 일상 속에서 AI가 자연스럽게 스며들어 대중화될 수 있도록 앞장서고 있다.

KT의 믿:음은 사전 학습부터 자체적으로 만든 한국적 독자 AI 모델로서, 고품질 한국어 데이터를 준비하는 과정에서 모든 저작권을 확보하여 신뢰성을 높였다.

이번에 KT가 한국적 AI라는 철학을 담아 새롭게 선보이는 믿:음 모델은 △115억 파라미터 규모의 '믿:음 2.0 Base', △23억 파라미터 규모의 '믿:음 2.0 Mini' 2종으로, 모두 한국어와 영어를 지원한다.

믿:음 2.0 Base는 범용 서비스에 적합한 모델로, 한국 특화 지식과 문서 기반의 질의응답에서 강력한 성능을 나타낸다. 믿:음 2.0 Mini는 Base 모델에서 증류한 지식을 학습한 소형 모델이다. 110억 파라미터 이상의 한국어 범용 LLM을 누구나 상업적으로 활용할 수 있는 오픈소스로 공개한 것은 KT가 처음이다.

믿:음 모델은 한국어와 한국 문화 및 사회 등의 전문 분야에서 기존의 국내외 주요 모델을 상회하는 이해력과 생성 성능을 입증했다. KT와 고려대학교가 공동 개발한 한국어 AI 역량 평가 지표인 'Ko-Sovereign(코-소버린)' 벤치마크에서 유사 규모의 국내 기성 모델을 비롯해 글로벌 최고 수준의 오픈소스 모델을 능가하는 점수를 기록했다.

이와 함께, 한국과 관련한 전문 지식의 이해도를 측정하는 대표적 벤치마크 'KMMLU'와 한국어 언어모델 평가 지표인 'HAERAE'에서도 믿:음은 국내외 주요 오픈소스 모델보다 더 우수한 성능을 기록했다.

KT는 국내 교육용 도서와 문학 작품 등의 발간물, 법률 및 특허 문서, 각종 사전 등 다양한 산업·공공·문화 영역에서 방대한 한국 특화 데이터를 확보해 믿:음 2.0 학습에 활용했다. 또 저작권 이슈가 있는 데이터는 모두 제거하는 등 KT의 Responsible AI 원칙에 따라 고품질 데이터를 선별하여 가공했다.

이외에도 한국어의 구조와 언어학적 특성을 반영한 토크나이저(Tokenizer)를 자체 개발하고, 필터링으로 줄어든 데이터 규모는 데이터 합성 방법론을 적용해 보완했다.

특히 KT는 믿:음 2.0에 AI의 윤리성 및 신뢰성을 높이기 위해 국내외 정책과 가이드라인을 기반으로 전문가들과 함께 만든 'AI 영향 평가 체계'를 적용해 보다 안전하고 투명한 기술을 구현하는 데 힘썼다.

KT 생성형 AI 랩장(CAIO) 신동훈 상무는 "모델들은 한국적 가치에 대해서 굉장히 중점을 두고 튜닝이 되었기 때문에 한국 문화나 역사와 관련된 질문들에 대해서 굉장히 잘 답변을 할 수 있는 상황"이라며, "한국적인 뉘앙스나 한국적인 미세한 감정 표현들 같은 것들도 잘 캐치할 수 있도록 학습에 노력을 기울였다"고 말했다.

또 믿:음 개발 단계에서 리벨리온과 긴밀히 협력하며 국산 AI 반도체에서의 동작을 최적화했고, 프렌들리AI와 함께 사용자가 별도의 설치 과정 없이도 허깅페이스를 통해 무료로 편리하게 체험해볼 수 있는 환경도 한시적으로 제공한다.

KT는 믿:음 2.0을 공개하며 본격적으로 국내 AI 생태계에 '한국적 AI' 확산 선도에 나선다. 마이크로소프트와의 협업으로 GPT-4에 한국적 사고를 추가 학습시키는 방식의 모델 또한 순차적으로 공개할 예정이다.

정부의 독자 AI 파운데이션 모델 사업 참여에 대한 의지도 밝혔다. 신 상무는 "저희도 당연히 정부의 독자 파운데이션 모델 프로젝트에 참여를 하려고 준비를 하고 있다"며, "한국적인 가치와 문화를 담아내기 위해서 저희가 데이터 얼라이언스와 그동안의 1년여 간의 노력을 거쳐서 구축한 데이터들이 이 독자 AI 파운데이션 모델을 구축하는 데 큰 강점이 될 것"이라고 밝혔다.

지금 뜨는 뉴스

※CBS노컷뉴스는 여러분의 제보로 함께 세상을 바꿉니다. 각종 비리와 부당대우, 사건사고와 미담 등 모든 얘깃거리를 알려주세요.

이메일 jebo@cbs.co.kr
카카오톡@노컷뉴스
사이트https://url.kr/b71afn

CBS노컷뉴스 박성은 기자 CBS노컷뉴스 박성은 기자메일