
AMD가 자사 GPU와 자사 소프트웨어를 사용해 개발한 AI 모델인 인스텔라-MoE(Instella-MoE)를 공개했다. 인스텔라-MoE는 사전 학습 완료 모델과 중간 학습 완료 모델 등 다양한 변형이 무료로 공개되어 있으며 학습에 사용된 코드와 프레임워크도 공개됐다.
인스텔라-MoE는 AMD의 AI 개발용 GPU인 인스팅트 MI300X(Instinct MI300X)와 인스팅트 MI325X를 사용해 개발된 AI 모델. 추론 시 일부 파라미터만 활성화하는 MoE 모델로 개발됐으며 전체 파라미터 수는 160억, 활성 파라미터 수는 28억이다.
인스텔라-MoE는 6종류 모델이 공개됐다. Instella-MoE-16B-A3B-Pretrain은 7조 1,000억 토큰 데이터셋으로 학습한 사전 학습 완료 모델. Instella-MoE-16B-A3B-Midtrain은 수학·코딩·사고 능력을 강화한 중간 학습 완료 모델이며 Instella-MoE-16B-A3B-Base는 컨텍스트 윈도를 64k 토큰으로 확장한 베이스 모델이다. 또 Instella-MoE-16B-A3B-SFT는 베이스 모델에 지도 학습 기반 파인튜닝을 적용한 모델, Instella-MoE-16B-A3B-DPO는 SFT 모델에 직접 선호 최적화를 적용한 모델이며 마지막으로 Instella-MoE-16B-A3B-Think는 DPO 모델에 강화 학습을 적용한 모델이다.
Instella-MoE-16B-A3B-Base는 벤치마크에서 Qwen3.5-4B-Base보다 낮은 점수를 기록했지만 동등 규모 모델보다는 높은 점수를 기록했다. Instella-MoE-16B-A3B-Think와 경쟁 모델 성능 비교에서는 젬마-4-E4B-it(Gemma-4-E4B-it)보다 적은 활성 파라미터 수로 높은 점수를 달성했다.
인스텔라-MoE는 AMD가 개발한 트레이닝 프레임워크 프리무스(Primus)와 MoE 아키텍처인 파스킵-컬렉티브(FarSkip-Collective)를 사용해 학습됐다. 또 인스텔라-MoE 학습에 사용된 코드베이스도 공개되어 있다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[DailyRecipe] 15억 투자 예약…디캠프 배치 3기 스타트업 7곳](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2025/06/250618_dcamp_ai_0005553252353.jpg?resize=350%2C250&ssl=1)
