
미국 AI 스타트업 리플렉션(Reflection)이 파라미터 5,010억개에 활성 파라미터 230억개 규모 오픈모델 빔(Beam)을 공개했다.
빔은 사전학습과 강화학습에 대규모로 투자해 만든 오픈모델이다. 사전학습에는 웹과 자체 라이선스를 확보한 데이터셋에서 모은 다양하고 엄선된 고품질 토큰 23조8,000억개를 썼다. 리플렉션은 그 결과 공개된 같은 규모 오픈모델과 같거나 더 나은 성능을 냈다고 설명했다.
이와 함께 막대한 컴퓨팅 자원이 드는 강화학습을 대규모로 이어가는 데 필요한 알고리즘과 학습 환경, 인프라도 개발했다. 강화학습에는 엔비디아(NVIDIA) GB300 1만500개를 투입했고 4주 학습으로 롤아웃 1억회 이상을 생성했다. 롤아웃은 AI 모델이 답변이나 일련의 행동을 만들어 내는 시도를 말한다.
리플렉션은 사전학습과 강화학습을 결합해 오픈웨이트 모델로서 경쟁력 있는 성능과 최고 수준 추론 연산 효율을 함께 갖췄다고 주장했다. 빔은 현재 마지막 단계 레드티밍과 평가를 받고 있어 아직 공개되지 않았다. 레드티밍은 공격적 테스트로 안전성을 검증하는 과정이다. 리플렉션은 10월 안에 빔 전체 가중치를 공개할 예정이며 대기자 명단 등록도 받고 있다.
◇ 코딩·에이전트 성능 앞세워=빔은 코딩과 에이전트 성능에 무게를 두고 학습했다. 리플렉션은 빔이 서구권 오픈웨이트 모델 수준을 끌어올렸다며 코딩과 에이전트 작업에서 GLM 5.2 같은 더 큰 오픈모델에 맞먹고 큐웬 3.8 맥스(Qwen 3.8-Max)에 근접한 성능을 낸다고 설명했다. 키미 K3(Kimi K3) 같은 최첨단 오픈모델에는 순수 능력에서 아직 못 미치지만 추론 효율에서는 강점이 있다고 덧붙였다.
리플렉션은 빔을 GLM 5.2와 큐웬 3.8 맥스, 잉클링(Inkling), 네모트론 울트라(Nemotron Ultra) 등 오픈모델과 여러 벤치마크로 비교했다. AI 코딩 에이전트 벤치마크 DeepSWE와 터미널 환경에서 AI 에이전트 실무 수행 능력을 종합 측정하는 Terminal Bench가 포함됐다. 검색이나 코드 실행 같은 외부 도구 없이 모델 본연의 지식과 사고력을 평가하는 HLE No Tools도 썼다. 저장소 단위 복잡한 과제 해결 능력을 재는 SWE Bench Pro와 소프트웨어 개발을 얼마나 자율적으로 해내는지 측정하는 SWE Bench Verified, 연구자 수준 물리학 추론 능력을 보는 CritPT AA도 활용했다. 빔은 모든 벤치마크에서 비교 대상 오픈모델과 비슷한 성능을 보였다.
빔은 추론 효율도 높다. 고난도 추론 벤치마크에서 GLM 5.2와 맞먹는 점수를 3분의 1에서 4분의 1 수준 추론 연산량으로 냈다. 파라미터가 2조개를 넘는 큐웬 3.8 맥스 같은 모델군과 비교하면 효율 격차는 더 벌어진다.
리플렉션은 빔이 토큰당 더 높은 지적 능력을 발휘해 높은 성능을 낮은 비용으로 제공할 수 있다며 기업 코딩과 에이전트 업무를 떠받치는 강력한 실용 모델이 될 것이라고 밝혔다.
◇ 공개가 더 안전하다=미샤 라스킨(Misha Laskin) 리플렉션 최고경영자(CEO)는 빔을 오픈모델로 내놓는 이유를 설명했다. 그는 인터넷이 개방형 프로토콜 위에 세워졌고 가장 널리 쓰이는 운영체제도 개방형이라며 사이버보안 분야가 존재하는 것도 1990년대 강력한 암호화 프로토콜이 공개됐기 때문이라고 말했다. 개방성은 안전성 향상으로도 이어지며 최선의 방어는 분산형이라는 게 그의 설명이다. 널리 쓰이는 오픈소스 소프트웨어는 개발자 커뮤니티가 검사하고 패치하기 때문에 견고하고 실전에서 검증됐다는 것이다.
그는 AI가 소프트웨어와 다르지만 여러 면에서 비슷하며 취약점 표면적은 훨씬 넓다고 짚었다. 소수 안전 연구자가 비밀리에 일하는 것만으로는 잠재적 문제를 모두 고칠 수 없다고 했다. AI는 과학과 기술 양쪽에서 토대가 되는 만큼 공개하는 게 가장 안전하고 AI 혜택을 고르게 나누는 길이라고 강조했다. 이어 개발자와 과학자가 이 모델로 무엇을 만들고 배울지 기대된다며 빔이 AI를 누구나 쓸 수 있고 안전하며 모두에게 이로운 기술로 만드는 데 작은 역할을 하게 돼 기쁘다고 덧붙였다.
리플렉션 기술 스태프 잭 웬츠(Zach Wentz)는 메타(Meta)에서 이끌던 팀보다 훨씬 작은 팀과 적은 컴퓨팅 자원으로 이런 오픈모델을 만들어 냈다며 연구 조직과 깊은 협력이 없었다면 불가능한 성과였고 리플렉션에서 그런 관계를 맺어 정말 운이 좋다고 말했다.
또 다른 기술 스태프 알렉스 폴로조프(Alex Polozov)는 빔이 리플렉션 첫 오픈웨이트 모델이라며 AI 업계에서 본 가장 뛰어난 팀 가운데 하나가 1년 가까이 쏟은 노력과 독창성, 동료애가 맺은 결실이라고 밝혔다. 그는 2025년 11월 합류했을 때 사전학습이 막 시작된 단계여서 인원 5~10명과 코드 조금이 전부였다고 돌아봤다. 당시에는 크롤러와 안정적인 GPU 인프라, 중복 제거 파이프라인, 자체 평가 체계는 물론 충분히 큰 전문가혼합(MoE) 모델도 없었다고 했다. 이 모든 작업은 2026년 들어 본격화했고 그가 겪은 가장 만족스러운 스프린트 가운데 하나였다는 설명이다.
리플렉션에서 데이터 플랫폼팀을 이끈 제이크 네이션스(Jake Nations)는 맨바닥에서 시작해 모델 구축에 필요한 파이프라인과 스토리지, 추론, 인프라, 도구를 모두 만들었다고 말했다. 그는 빔이 토큰 23조8,000억개로 학습했다며 팀이 만든 OCR 파이프라인이 PDF 수억건에서 토큰 수조개를 뽑아낸 데 가장 자부심을 느낀다고 밝혔다.
오픈모델을 관리하고 실행하는 오픈소스 런타임 플랫폼 올라마(Ollama)도 빔 등장을 반겼다. 리플렉션 창업자들이 서구판 딥시크(DeepSeek)를 목표로 빔을 개발한 뒷이야기를 전하는 인터뷰 영상도 공개됐다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 이소영 중기부 장관, 중소기업계와 첫 소통‧제주창경, 1차 모창 ‘공개 오디션’ 개최](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261008_korea_0502305205235_slimpic.webp?resize=75%2C75&ssl=1)

