x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

독일 AI 스타트업 알레프알파(Aleph Alpha)가 독일 통일의 날인 10월 3일 새 언어모델 콜리브리(Kolibri)를 발표했다.

콜리브리는 전체 파라미터 780억개를 갖추면서도 활성 파라미터를 30억개로 묶은 효율적 설계가 특징이다. 발표 시점 기준으로 영어와 독일어를 지원하며 컨텍스트 길이는 최대 100만 토큰이다. 알레프알파는 정교한 학습 파이프라인으로 데이터 수집부터 큐레이션과 어블레이션, 사전학습, 사후학습, 최종 평가까지 전 과정을 자동화했다고 설명했다. 하드웨어 장애나 데이터 연결 문제가 생겨도 사람이 개입하지 않고 실험 수백건과 안정적인 사전학습을 돌릴 수 있다는 것이다.

콜리브리가 쓰일 곳으로 상정한 분야는 공공행정과 산업, 항공우주처럼 규제가 엄격하고 중대 업무를 맡는 영역이다. 독일어 처리 능력과 추론, 수학, 에이전트 동작, 고객별 사용 사례에 맞춘 기능에서 강점을 보인다.

콜리브리는 토큰을 처리할 때마다 전체 파라미터 780억개 가운데 활성 파라미터 30억개만 써서 모델 성능과 배포 비용 사이 균형을 맞췄다. 알레프알파가 공개한 그래프는 가로축에 처리 속도를, 세로축에 벤치마크 점수를 놓고 여러 오픈모델의 영어와 독일어 처리 성능을 비교했다. 콜리브리는 두 언어 모두에서 같은 속도 모델 가운데 가장 높은 성능을 기록했다.

벤치마크에서 콜리브리는 수학과 코딩, 그라운딩, 긴 문맥 작업에서 네모트론 3 슈퍼(Nemotron 3 Super)처럼 활성 파라미터가 최대 4배 많은 모델에 맞먹는 성능을 냈다.

◇ 구축부터 이전까지 주권 확보=알레프알파는 주권을 모델을 만드는 방식과 고객에게 넘기는 방식 양쪽에서 정의한다. 모델 구축 측면에서는 가중치와 큐레이션의 투명성을 확보해 개발 배경이 된 의사결정 과정을 드러내고 추론 궤적으로 모델이 특정 답변에 이른 경위를 설명할 수 있도록 하는 데 무게를 뒀다. 알레프알파가 자체 개발한 멀린-아서(Merlin-Arthur) 프로토콜이 모델 신뢰성을 뒷받침해 문맥이 답변을 뒷받침하지 못하면 콜리브리는 답변을 삼가고 환각을 줄인다.

콜리브리는 독일에서 만들었다. 데이터 큐레이션부터 사전·사후 학습과 모델 팩토리 최적화에 이르는 파이프라인 전체를 독일과 핀란드 인프라에서 유럽과 독일 법률에 따라 외국 통제 없이 학습했다. 알레프알파는 이런 전 과정 파이프라인 관리가 모델 주권의 토대라고 설명했다. 관리 권한이 고객에게도 넘어가 배포 자유도를 온전히 누릴 수 있고 비용과 지연 시간을 답변 품질과 맞바꾸는 추론 처리도 직접 제어할 수 있다는 것이다.

콜리브리는 독일어와 영어를 함께 다루는 토크나이저를 새로 개발했고 사전학습 전 과정에 원어 독일어 데이터를 녹여 넣는 데 공을 들였다. 사전학습 토큰 가운데 21.3%가 독일어이며 번역 데이터 사용은 최소한으로 줄였다. 영어 모델이 독일어를 읽을 줄 아는 수준이 아니라 설계 단계부터 이중언어 모델로 작동한다는 얘기다.

콜리브리는 아파치 라이선스 2.0(Apache License 2.0)으로 공개된 오픈모델이며 aleph-alpha-inference 패키지와 콜리브리 vLLM 플러그인으로 쓸 수 있다. 컨테이너 이미지도 제공하고 pip로도 설치할 수 있으며 모델은 내려받아 쓸 수 있다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts

Next Post