
구글이 이미지 생성 AI 나노 바나나 2.1(Nano Banana 2.1)을 발표했다. 5월 정식 출시한 나노 바나나 2 업데이트 버전이다. 제미나이 3.6 플래시(Gemini 3.6 Flash)를 기반으로 해 플래시 수준 속도와 비용 효율을 유지했다. 1K와 2K, 4K 해상도에서 시각 품질과 텍스트 렌더링을 끌어올렸고 멀티턴 일관성과 구글 검색 그라운딩도 개선했다.
새 모델은 1K·2K·4K 출력 해상도에서 화질과 사실감을 높였다. 기본 해상도는 1K다. 2K와 4K 해상도에서는 1:4와 4:1, 1:8과 8:1 같은 와이드·파노라마 화면비에서 생기던 타일링 아티팩트를 고쳤다. 텍스트 렌더링과 인포그래픽 레이아웃 정확도도 올라갔다. 참조 이미지를 최대 14장까지 받는 다중 이미지 융합 기능으로 캐릭터 최대 4명의 일관성과 사물 최대 10개의 충실도를 유지한다. 구글 웹 검색과 이미지 검색을 통한 그라운딩을 지원하며 사고 수준은 최소(minimal)와 중간(medium), 높음(high) 3단계로 설정할 수 있다.
구글은 나노 바나나 2.1이 최신 고효율 이미지 생성·편집 모델로서 제미나이 3 프로 이미지(Gemini 3 Pro Image), 즉 나노 바나나 프로(Nano Banana Pro)보다 효율적인 대응 모델 역할을 한다고 설명했다.
◇ 자체 벤치마크서 전 항목 1위=구글이 공개한 텍스트-이미지 변환 벤치마크는 나노 바나나 2.1 사고 모드와 비사고 모드, 제미나이 3.1 플래시 이미지(Gemini 3.1 Flash Image)로 불리는 나노 바나나 2 사고 모드, 나노 바나나 프로를 비교했다. 종합 선호도와 인포그래픽 디자인, 인포그래픽 정확도 3개 항목 모두에서 나노 바나나 2.1 사고 모드가 가장 앞섰다. 편집 능력 벤치마크에서도 일반 편집과 단일 캐릭터 일관성, 복수 캐릭터 일관성, 마스크·잉크 기반 편집, 제품 일관성, 스타일화, 복수 참조 편집까지 7개 항목 모두 나노 바나나 2.1 사고 모드가 최고 점수를 기록했다.
한계도 있다. 구글은 작은 글자나 긴 문단, 페이지 분량 텍스트는 여전히 제대로 렌더링하지 못한다고 밝혔다. 입력 이미지와 생성 이미지 사이 캐릭터 일관성이 늘 완벽하지는 않고 좌우 같은 공간 관계를 가끔 혼동한다. 세계 지식과 3D 추론, 사실 인식 같은 고급 능력도 아직 제한적이다. 제미나이 3.6 플래시 지식 기준일은 2026년 3월이지만 일부 분야에서는 2025년 1월까지 지식만 쓸 수 있는 경우도 있다. 자세한 제한 사항은 제미나이 3.6 플래시 모델 카드에서 확인할 수 있다.
◇ 무료 이용자는 플래시 라이트만=구글은 10월 9일부터 개인 무료 이용자가 쓸 수 있는 제미나이 모델을 경량 고속 모델인 플래시 라이트(Flash-Lite)로 제한한다. 지금까지는 무료 이용자도 플래시를 쓸 수 있었다. 구독 요금제 AI 플러스(AI Plus)는 그동안 프로 모델까지 지원했지만 앞으로는 플래시까지만 쓸 수 있다. 제미나이 프로를 쓰려면 AI 프로(AI Pro)나 AI 울트라(AI Ultra)에 가입해야 하며 두 요금제는 플래시 라이트와 플래시, 프로를 모두 지원한다. 무료 이용자 변경은 10월 9일부터 적용되고 AI 플러스 가입자는 변경 내용을 이메일로 안내받는다.
구글은 처음에 제미나이를 무료판과 유료 요금제 2가지로 제공했다. 2025년 5월 제한이 가장 적은 AI 울트라를 내놓으면서 기존 유료 요금제 이름을 AI 프로로 바꿨다. AI 플러스는 가장 최근에 나온 저가 요금제다. 관련 내용은 이곳에서 확인할 수 있다.
◇ 스마트폰 실행 가능한 멀티모달 임베딩 모델 공개=한편 구글은 새 임베딩 모델 임베딩젬마 2(EmbeddingGemma 2)를 발표했다. 임베딩 모델은 AI가 데이터 의미와 특징을 다루기 쉽도록 텍스트나 이미지 등을 숫자 벡터로 표현하는 모델이다.
임베딩젬마 2는 텍스트를 넘어 코드와 이미지, 동영상, 음성을 하나의 임베딩 공간에 통합한다. 이 모델을 쓰면 앱이 기기 안에서 정보를 직접 정리하고 검색하며 서로 연결할 수 있어 온디바이스 검색 도구나 개인정보 보호를 앞세운 검색증강생성(RAG)을 개발할 수 있다.

파라미터는 7억4,000만개다. 대규모 텍스트 임베딩 벤치마크(MTEB)와 대규모 오디오 임베딩 벤치마크(MAEB) 등에서 파라미터 10억개 미만 멀티모달 임베딩 모델 가운데 크기 대비 최고 수준 성능을 냈다.
텍스트만 처리하는 작업에서는 파라미터 2억7,000만개만으로 돌아간다. 비전 인코더(파라미터 1억7,000만개)와 음성 인코더(파라미터 3억개)를 더하면 완전한 멀티모달 기능을 쓸 수 있다. 마트료시카 표현 학습(Matryoshka Representation Learning, MRL)을 적용하면 개발자가 출력 벡터를 768차원에서 512차원과 256차원, 128차원으로 상황에 맞게 줄일 수 있다. 이를 통해 로컬 벡터 데이터베이스와 메모리 사용량을 최대 6분의 1로 줄인다.
We’re releasing EmbeddingGemma 2, our first natively multimodal open model engineered for on-device embeddings.
Built on the Gemma 4 architecture and released under an Apache 2.0 license, it goes beyond text to unify images, video, audio, and code in a single embedding space.
— Google (@Google) October 6, 2026
모바일과 데스크톱에서 로컬로 실행하도록 최적화했다. 구글 픽셀 11 프로(Google Pixel 11 Pro)에서는 텍스트 전용 가중치에 필요한 활성 RAM을 최소 191MB까지, 완전한 멀티모달 모델은 567MB까지 낮출 수 있다. 컨텍스트 창은 8K 토큰으로 이전 모델 임베딩젬마보다 4배 넓어졌다. 덕분에 음성 최대 5.5분이나 이미지 29장, 동영상 58프레임 또는 이들을 조합한 입력을 로컬 하드웨어에서 바로 처리할 수 있다.
임베딩젬마 2는 젬마 4(Gemma 4) 아키텍처를 바탕으로 만들었고 상업적 이용에도 너그러운 아파치 2.0 라이선스로 공개됐다. 모델 가중치는 허깅페이스(Hugging Face)와 캐글(Kaggle)에서 받을 수 있으며 제미나이 엔터프라이즈 에이전트 플랫폼 모델 가든(Gemini Enterprise Agent Platform Model Garden)에서도 곧 쓸 수 있게 된다. 2025년 9월 나온 임베딩젬마는 지금까지 2,000만회 넘게 내려받았다. 관련 내용은 이곳에서 확인할 수 있다.
![[DailyRecipe] 막 오른 넥스트라이즈2026…올해 특징은?](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/06/260618_nextrise_ai_0023052050235235.jpg?resize=350%2C250&ssl=1)
![[AI서머리] 마스오토, 美교통부와 자율주행 트럭 상용화 논의‧인터디멘션, 알짜경매 출시](https://i0.wp.com/startuprecipe.co.kr/wp-content/uploads/2026/10/261008_MARS-AUTO_502050250_slimpic.webp?resize=75%2C75&ssl=1)

