
구글이 9월 30일 새 AI 모델 제미나이 4 아르곤(Gemini 4 Argon)을 발표했다. 제미나이 4 아르곤은 여러 공정에 걸친 작업을 오랜 시간 이어가는 능력에 무게를 둔 모델로 소프트웨어 개발과 기업 지식 노동, 사이버 보안 방어 등에서 높은 성능을 보였다. 기사 작성 시점에는 일반 공개되지 않았고 신뢰할 수 있는 사이버 보안 담당자 등에게 제공되고 있다.
구글 내부에서는 이미 직원 수천 명이 아르곤을 코딩과 조사, 문서 작성에 쓰고 있다. 순다르 피차이(Sundar Pichai) 구글 최고경영자는 차기 모델을 둘러싼 논의가 넓어지고 있어 가능한 한 빨리 선행 공개하고 싶었다고 엑스(X)에 설명했다. 복잡한 워크플로와 사이버 방어, 소프트웨어 개발에서 최첨단 성능을 보이고 있으며 사내 여러 팀이 쓰고 있다고 밝혔다.
◇ 벤치마크로 본 성능은?=구글이 공개한 벤치마크에서 제미나이 4 아르곤은 지식 노동과 에이전트형 코딩, 긴 컨텍스트 처리, 멀티모달 이해 등 폭넓은 분야에서 높은 점수를 기록했다.
실제 코드베이스를 써서 장시간 소프트웨어 개발 능력을 평가하는 딥SWE v1.1(DeepSWE v1.1)에서는 77.9%를 기록했다. 비교 대상인 GPT-6 아스트라(GPT-6 Astra)는 74.1%, 클로드 오푸스 5.5(Claude Opus 5.5)는 74.2%, 클로드 페이블 5.1(Claude Fable 5.1)은 67.4%였다.
기업 실무 능력을 평가하는 발스 인덱스(Vals Index)에서는 68.9%를 기록해 GPT-6 아스트라 63.1%와 클로드 오푸스 5.5 67.0%, 클로드 페이블 5.1 65.8%를 모두 웃돌았다.
금융 분야 조사·분석 능력을 보는 발스 파이낸스 에이전트 v2(Vals Finance Agent v2)에서는 65.4%를 기록했다. 비교 대상은 클로드 페이블 5.1이 58.9%, 클로드 오푸스 5.5가 58.6%, GPT-6 아스트라가 53.5%로 아르곤이 가장 높았다. 구글은 이런 결과를 근거로 아르곤이 여러 단계를 거쳐야 하는 금융 조사에서도 높은 성능을 보였다고 설명했다.
업무 자동화 능력을 재는 오토메이션벤치(AutomationBench)에서도 51.3%로 GPT-6 아스트라 41.4%와 클로드 오푸스 5.5 42.5%를 앞섰다. 반면 프런티어SWE v2(FrontierSWE v2)에서는 55.0%에 그쳐 GPT-6 아스트라 65.5%와 클로드 오푸스 5.5 62.3%에 못 미쳤다.
이 밖에 코드 생성을 평가하는 바이브 코드 벤치(Vibe Code Bench)에서 91.9%, 장시간 영상 이해를 보는 LV벤치(LVBench)에서 91.7%를 기록했다. 긴 입력을 다루는 그래프웍스(GraphWalks) 점수는 최대 12만8,000토큰 조건에서 99.7%, 25만6,000~100만 토큰 조건에서 84.2%였다. 한 번 처리로 생성할 수 있는 출력 상한도 종전 6만4,000토큰에서 100만 토큰으로 늘었다.
◇ 사내 개발에도 투입=구글은 아르곤을 사내 개발 작업에도 쓰고 있다. 양자컴퓨팅용 알고리즘 최적화에서는 필요한 계산 자원을 기존 연구 기준 대비 40% 개선했다고 보고했다. 데이터센터에서는 아르곤 에이전트 여러 개가 프로파일링 정보를 분석해 메모리 사용량을 자율적으로 최적화했다. 그 결과 도입을 마친 범위에서만 300TiB 이상을 줄였고 최종 절감량은 500TiB에서 1PiB에 이를 전망이다.
C/C++로 쓰인 코드를 러스트(Rust)로 옮기는 작업에도 아르곤을 쓰고 있다. 대상은 수만 줄 규모 라이브러리부터 80만 줄이 넘는 퓨시아(Fuchsia) 지르콘(Zircon) 커널까지 걸쳐 있다. 영상 디코더 립가브원(libgav1)에서는 기존 러스트 이식판에 들어 있던 SIMD 코드 3만2,000줄을 다시 쓴 결과 같은 영상 출력을 유지하면서 러스트판 처리 속도를 2.7배로 끌어올렸다.
Today we’re introducing Gemini 4 Argon.
It delivers frontier performance in complex workflows across real-world software engineering, knowledge work, and cybersecurity defense with an industry-leading 1M token output limit.
— Google (@Google) September 30, 2026
◇ 병원 의료 소프트웨어에서 취약점 발견=구글은 아르곤 개발에서 사이버 보안 방어에도 무게를 뒀다. 아르곤은 소프트웨어 취약점을 자율적으로 찾아내 유효성을 검증한 뒤 수정할 수 있다. 취약점 수정 능력을 재는 CWE-벤치 v1(CWE-bench v1)에서는 GPT-6 아스트라와 같은 68%를 기록했다. 구글 비교로는 클로드 오푸스 5.5 67%와 클로드 페이블 5.1 58%를 웃돌았다.
취약점 발견 능력은 구글 사내 평가에서 85.8%를 기록해 제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber) 71.0%를 앞섰다. 위즈(Wiz)가 진행한 침투 테스트에서도 아르곤은 70.9%로 제미나이 3.8 플래시 사이버 58.2%를 웃돌았다. 이 테스트는 소스코드를 주지 않고 실제 웹 시스템을 조사하게 하는 방식이다. 이 과정에서 위즈는 아르곤을 써서 세계 각지 병원에서 쓰이는 의료 소프트웨어에서 중대한 취약점을 발견했다고 한다.
구글은 아르곤이 지닌 고도의 사이버 능력을 감안해 단계적으로 공개를 진행하고 있다. 현재는 페어윈드 프로그램(Fairwind Program)을 통해 신뢰할 수 있는 사이버 방어 담당자 등에게 제공한다. 미국 정부가 출시 전 모델에 접근하는 자율 절차에도 참여하고 있다.
안전 대책으로는 악의적 사이버 공격과 화학·생물·방사선·핵 관련 요구를 거부하는 구조를 강화했다. 프롬프트 인젝션 내성도 높여 그레이스완(Gray Swan)이 간접 프롬프트 인젝션 공격을 수행하는 벤치마크에서 아르곤 공격 성공률은 0.7%였다. 비교 대상 모델 가운데 가장 낮은 값이다. 모델 추론 과정과 행동을 감시하는 구조도 넣어 이용자 의도에서 벗어난 행동을 감지하면 실행을 멈춘다.
◇ 평가 주체 따라 순위 갈려=제3자 기관 아티피셜애널리시스(Artificial Analysis) 평가에서 아르곤은 오토메이션벤치-AA(AutomationBench-AA) 77.5%를 기록해 클로드 소네트 5.5(Claude Sonnet 5.5) 71.3%를 6%포인트가량 앞섰다고 보고됐다. 반면 터미널 벤치 4(Terminal Bench 4)에서는 57%가량에 그쳐 클로드 소네트 5.5 64%와 클로드 오푸스 5.5 60%에 못 미쳤다. 평가하는 작업에 따라 모델 간 순위가 달라지는 셈이다.
일반 제공 때 예정 가격은 입력 100만 토큰당 2달러(2,800원대), 출력 100만 토큰당 10달러(1만4,000원대)다. 캐시된 입력 토큰에는 통상 입력 가격에서 95% 할인이 적용된다. 구글은 초기 테스터 피드백을 바탕으로 안전 대책을 조정할 방침이다. 그 뒤 유료 API 이용자와 구글 AI 울트라(Google AI Ultra) 이용자를 시작으로 개발자와 기업, 일반 이용자로 제공 범위를 넓힐 예정이다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 관악연구소, 3억원 투자 유치‧제이드래곤게임즈, 투자 유치](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261002_StealCut_5020502053_slimpic.webp?resize=75%2C75&ssl=1)
![[AI서머리] 토스, 제주은행과 개인사업자 포용금융 MOU‧네이버 웨일, ‘AI Chat’ 출시](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261001_naver_0099999999_slimpic.webp?resize=350%2C250&ssl=1)
