x

이메일로 만나보는 스타트업 가이드

투자, 행사, 정부사업 등 스타트업 생태계 소식을 이메일로 편하게 받아보세요.

AMD가 자사 GPU와 자사 소프트웨어를 사용해 개발한 AI 모델인 인스텔라-MoE(Instella-MoE)를 공개했다. 인스텔라-MoE는 사전 학습 완료 모델과 중간 학습 완료 모델 등 다양한 변형이 무료로 공개되어 있으며 학습에 사용된 코드와 프레임워크도 공개됐다.

인스텔라-MoE는 AMD의 AI 개발용 GPU인 인스팅트 MI300X(Instinct MI300X)와 인스팅트 MI325X를 사용해 개발된 AI 모델. 추론 시 일부 파라미터만 활성화하는 MoE 모델로 개발됐으며 전체 파라미터 수는 160억, 활성 파라미터 수는 28억이다.

인스텔라-MoE는 6종류 모델이 공개됐다. Instella-MoE-16B-A3B-Pretrain은 7조 1,000억 토큰 데이터셋으로 학습한 사전 학습 완료 모델. Instella-MoE-16B-A3B-Midtrain은 수학·코딩·사고 능력을 강화한 중간 학습 완료 모델이며 Instella-MoE-16B-A3B-Base는 컨텍스트 윈도를 64k 토큰으로 확장한 베이스 모델이다. 또 Instella-MoE-16B-A3B-SFT는 베이스 모델에 지도 학습 기반 파인튜닝을 적용한 모델, Instella-MoE-16B-A3B-DPO는 SFT 모델에 직접 선호 최적화를 적용한 모델이며 마지막으로 Instella-MoE-16B-A3B-Think는 DPO 모델에 강화 학습을 적용한 모델이다.

Instella-MoE-16B-A3B-Base는 벤치마크에서 Qwen3.5-4B-Base보다 낮은 점수를 기록했지만 동등 규모 모델보다는 높은 점수를 기록했다. Instella-MoE-16B-A3B-Think와 경쟁 모델 성능 비교에서는 젬마-4-E4B-it(Gemma-4-E4B-it)보다 적은 활성 파라미터 수로 높은 점수를 달성했다.

인스텔라-MoE는 AMD가 개발한 트레이닝 프레임워크 프리무스(Primus)와 MoE 아키텍처인 파스킵-컬렉티브(FarSkip-Collective)를 사용해 학습됐다. 또 인스텔라-MoE 학습에 사용된 코드베이스도 공개되어 있다. 관련 내용은 이곳에서 확인할 수 있다.

뉴스 레터 구독하기

Related Posts