[Paper Review] Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

논문리뷰 : https://arxiv.org/pdf/2605.27295

· 31분 읽기
[Paper Review] Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

최근 등장한 새로운 Embedding Model입니다. 바로 Gemini Embedding 2 인데요. 특히나 개인적으로 주목해야할 점이라고 한다면 Multi-Modal Data를 unified된 Representation Space에 임베딩한다는 지점이고, 그중에서도 tokenizing 부분에 이목이 끌리는 것 같습니다. 제대로 알아봅시다!

Abstract

  • 비디오, 오디오, 이미지 및 텍스트 modality를 통합된 하나의 representation space에 임베딩하는 Gemeini-Embedding 2 Model을 소개하고자 함.
  • Large Scale의 Contrastive Learning에 적용하고자 하였고, multi-task training & multi-stage training단계에서 적용한 결과 주요 임베딩 벤치마크상 SOTA performance를 달성하였다고 함.
  • 따라서 저자들은 해당 모델을 RAG, Recommendation System, Search와 같은 downstream task(+ 다양한 도메인)에 유효한 사용 모델로 추천하고 있음.

1. Introduction

1-1. 기존 Embedding Model의 경향성

  • Embedding Model은 다양한 task에 사용될 수 있는 가능성 때문에라도 의미론적 정보를 일관된 방식으로 포착하도록 보장해야 한다.
  • 다양한 모달리티에 걸쳐서 풍부한 정보를 포함하는 것이 궁극적인 목적이지만, 포함된 모든 모달리티가 동질성을 가지지 않기 때문에 특정한 학습 방식을 필요로 한다.
  • 기존의 모델들인 CLIP, ALIGN, SigLIP, CoCa 등은 heterogenous modalities를 임베딩하는데 목적이 있고, 이를 위해 late-fusion approach를 사용한다. (= paired cross-modal data를 사용해 modality specific encoder를 훈련하는 방식이라고 함)
  • 기존 방식(= late fusion)은 modality의 넓은 coverage를 제공하지만 각 modal간 interaction이 부족한 특징을 지닌다. 이후 MLLM(Multimodal Large Language Model)의 발전으로 semantic함이 풍부한 임베딩이 가능해졌다.
  • 따라서, 본 연구에서는 다양한 모달리티 및 조합을 single representation space로 임베딩하는 Gemini Embedding 2 Model을 학습하여 선보이고자 한다.

Figure02 : Gemini Embedding 2 shows strong performance across multimodal retrieval tasks spanning
image, text, video, and document modalities

  • Large Language Models as Text Embedders
    • text embedding model은 순수한 인코더 모델(e.g. BERT, RoBERTa)에서 시작해서 decoder model 및 large language model 백본으로 까지 이어진다.
    • BGE 또는 E5와 같은 모델들은 semantic search, clustering, classification 등의 downstream task를 task-specific prefix를 통해 단일 모델로 하여금 효과적으로 통합한다.
    • Gecko model과 같이 2-step distillation pipeline을 이용한 학습으로 high-efficiency retriever를 훈련할 수 있다.
    • NV-Embed은 Contrastive Learning과 non-retrieval synthetic data를 사용하여 decoder-only model을 general embedder로 변환함으로써 MMTEB LeaderBoard에서 강력한 성능을 달성했다.
    • Gemini Embedding은 Gemini Model의 Pre-training을 통해 합성 데이터를 활용하고 다국어 작업에 대한 우수한 일반화 성능을 보여 MMTEB 리더보드에서 최첨단 성능을 입증했다.
  • Evoltion of Multimodal Embedders
    • 초기 Multimodal Embedding의 패러다임은 CLIP 및 ALIGN과 같은 dual-tower model에서 볼 수 있듯이 간단한 image-text pair에 대한 제한적인 contrastive learning에 의존하는 한계가 있었다.
    • 오늘날 해당 분야는 text, code, image, structured document, audio 및 video를 unified & continuous semantic space으로 매핑할 수 있는 아키텍처로 나아가고 있다.
    • SAIL-Embedding은 멀티모달 표현을 산업계에서 추천되는 환경(e.g. seq-item predict, 실효성 있는 분야를 의미함)에 원활하게 적용될 수 있는 방법론을 사용한다.
    • Amazon Nova MME와 SigLIP 2는 cross-modal retrieval workflow를 위해 서로 다른 modality를 통합하는 데 강력한 성능을 입증했다.
  • Architectural Adaptations Bidirectional Attention
    • Casual LLM은 generative task에 뛰어나지만, 본질적으로 unidirection attention mechansism은 임베딩을 생성할 때 불필요한 사항이 많습니다.
    • 이러한 한계를 극복하기 위해 MoCa, MM-Embed와 같은 몇 가지 혁신적인 프레임워크가 등장했다.
  • Adaptation to Enterprise Use Cases
    • 기업 및 에이전트 요구 사항이 Massive Context로 확장되고 문서에 점점 더 집중됨에 따라, 최신 embedder는 방대한 정보 페이로드를 효율적으로 수집해야 한다.
    • 모델은 Complexity PDF, Chart 및 Table을 embedding하기 위해 특수화된 시각-문서 처리(예: 비전 인코더의 타일 혼합)를 활용하며, 이는 RAG 시스템의 품질이 청킹 전략 등과 같은 외부 파이프라인의 다양한 부분에 의존하게 만든다.

3. Multimodal Gemini Embedding

  • 본 섹션에서는 Multimodal Gemini Embedding 2를 모델 아키텍처, 목적 함수(objective function), 학습 레시피(training recipe) 세 가지 측면에서 기술적으로 설명한다.

3.1 Model Architecture

  • Gemini Embedding 2는 서로 다른 modality 및 이들을 조합한 입력에 대해 **holistic한 표현(representation)**을 생성하도록 설계되었으며, 이렇게 만들어진 표현은 retrieval, clustering, classification, ranking 등 다양한 downstream task에 활용될 수 있다.
  • 모델은 **Gemini로부터 초기화(initialize)**된 뒤 task-specific / modality-specific / cross-modality 학습으로 fine-tuning 된다. 즉, Gemini가 이미 보유한 방대한 지식 위에서 표현을 쌓아 올리는 방식이며, 이 초기화 단계 자체를 임베딩 모델의 “pre-training” 단계로 이해할 수 있다.
  • 이전 Gemini Embedding 모델과 유사한 방식으로 표현을 구성하지만, 핵심 차이점은 각 modality마다 raw format을 token sequence로 변환하는 단계가 다르다는 점이다. Gemini Embedding 2는 Gemini를 활용해 이러한 데이터/포맷 변환을 수행하므로, 이미지·비디오·오디오를 Gemini가 native하게 지원하는 형태로 그대로 입력받을 수 있다.
  • 처리 파이프라인은 다음과 같다. (T\mathbf{T}: LL개 토큰 시퀀스, M\mathcal{M}: 트랜스포머, P\mathcal{P}: pooler, ff: linear projection)
    • Tokenization : 입력을 LL개의 토큰 시퀀스 T\mathbf{T}로 변환한다.
    • Transformer M\mathcal{M} : Gemini로부터 초기화된 bidirectional attention 트랜스포머가 토큰 시퀀스를 처리하여 토큰 임베딩 Tembed=M(T)RL×dM\mathbf{T}_{embed} = \mathcal{M}(\mathbf{T}) \in \mathbb{R}^{L \times d_{\mathcal{M}}}를 생성한다.
    • Pooler P\mathcal{P} : 입력 전체 정보를 담는 단일 임베딩을 만들기 위해 pooler를 적용한다. 선행 연구에서 단순한 pooling 전략이 효과적임이 확인되었으므로, 시퀀스 축을 따라 단순 평균을 취하는 mean pooling을 사용한다 (Pembed=P(Tembed)\mathbf{P}_{embed} = \mathcal{P}(\mathbf{T}_{embed})).
    • Linear projection ff : 마지막으로 무작위 초기화된 선형 projection을 적용해 목표 차원 dd로 스케일링한다 (E=f(Pembed)Rd\mathbf{E} = f(\mathbf{P}_{embed}) \in \mathbb{R}^{d}).

3.2 Training Objective

  • Multimodal 특성상 서로 다른 modality를 별도의 task로 학습할 수 있도록 multi-task & multi-stage 방식의 학습이 요구된다. single-modality task, multimodal task, cross-modal task를 모두 활용한다.
  • 이전 버전과 마찬가지로 in-batch negative를 사용하는 noise-contrastive estimation(NCE) loss로 학습한다. 하나의 학습 예제는 query qiq_i, positive target pi+p_i^+, 그리고 (선택적으로) hard negative target pip_i^-로 구성된다.
    • 텍스트 전용 task에서는 “question answering”, “fact checking”과 같이 task의 성격을 기술하는 **task string tt**가 함께 주어진다. 학습 중에는 이 task string을 무작위로 drop하여, task string이 없는 다양한 modality 입력에 대한 robustness를 강화한다.
    • Query와 passage는 qi=f(mean_pool(M(tqi)))\mathbf{q}_i = f(\mathrm{mean\_pool}(\mathcal{M}(t \oplus q_i))), pi±=f(mean_pool(M(pi±)))\mathbf{p}_i^{\pm} = f(\mathrm{mean\_pool}(\mathcal{M}(p_i^{\pm}))) 형태로 임베딩된다.
  • Batch size BB에 대한 loss는 아래와 같으며, sim(x,y)=xy/(xy)\mathrm{sim}(\mathbf{x}, \mathbf{y}) = \mathbf{x}^\top \mathbf{y} / (\lVert\mathbf{x}\rVert \lVert\mathbf{y}\rVert)는 cosine similarity, τ\tau는 temperature이다.
L=1Bi=1B[logesim(qi,pi+)/τesim(qi,pi+)/τ+esim(qi,pi)/τ+j=1Bmask(i,j)esim(qi,pj+)/τ]\mathcal{L} = \frac{1}{B} \sum_{i=1}^{B} \left[ -\log \frac{e^{\mathrm{sim}(\mathbf{q}_i, \mathbf{p}_i^+)/\tau}}{e^{\mathrm{sim}(\mathbf{q}_i, \mathbf{p}_i^+)/\tau} + e^{\mathrm{sim}(\mathbf{q}_i, \mathbf{p}_i^-)/\tau} + \sum_{j=1}^{B} \mathrm{mask}(i,j)\, e^{\mathrm{sim}(\mathbf{q}_i, \mathbf{p}_j^+)/\tau}} \right] mask(i,j)={0if qi=qj or pi+=pj+1otherwise\mathrm{mask}(i, j) = \begin{cases} 0 & \text{if } q_i = q_j \text{ or } p_i^+ = p_j^+ \\ 1 & \text{otherwise} \end{cases}
  • 여기서 mask(i,j)\mathrm{mask}(i,j)qi=qjq_i = q_j 이거나 pi+=pj+p_i^+ = p_j^+일 때 00, 그 외에는 11의 값을 가진다. 이 masking 항은 label(target) 수가 적은 classification task에서 특히 중요하다. 또한 hard negative가 없는 경우 분모의 두 번째 항은 생략된다.
  • MRL(Matryoshka Representation Learning) 을 적용해 하나의 모델로 여러 차원의 임베딩을 지원한다. 임베딩 차원의 겹치는 sub-dimension들에 대해 kk개의 개별 loss를 두어(예: 첫 768차원, 첫 1,536차원 등) 학습한다. Gemini Embedding 2는 d=3,072d = 3{,}072 차원 임베딩을 제공하며 768 / 1,536 차원에 대해 MRL이 최적화되어 있다.

3.3 Recipe

  • multi-task 학습 setup에 크게 의존하여 서로 다른 task들이 각기 다른 방식으로 통합 임베딩 공간 형성에 기여하도록 하며, Gecko 및 Gemini Embedding에서 채택한 multi-stage 학습을 따른다.

  • Pre-Fine-Tuning (PFT)

    • 모델의 파라미터를 auto-regressive generation에서 encoding에 적합하도록 적응시키는 단계이다.
    • 잠재적으로 noisy할 수 있는 대량의 query–target pair를 multi-task setup으로 학습한다. 이때 큰 batch size를 사용하면 gradient가 안정되어 noisy 입력의 영향을 완화할 수 있다.
    • 이 단계에서는 image, text, code task만 사용하며, 각 task는 사전에 지정된 sampling rate로 샘플링되어 단일 task 배치를 구성한다.
  • Fine-Tuning (FT)

    • text, code, document, image, audio, video task를 대규모로 학습하는 단계이다. 전부는 아니지만 다수의 task가 (query, target, hard negative) triplet 예제를 포함한다.
    • 각 task별로 batch size를 조정해 해당 평가 성능을 개선하며, 배치는 하나의 single task에서 샘플링한다. modality 간 정렬(alignment)은 다수의 single-modality 배치와 cross-modality 배치를 함께 학습함으로써 이루어진다.
    • 경험적으로, 전체 modality에 걸친 성능 균형은 sampling rate·batch size 같은 hyper-parameter에 민감하게 반응하는 것으로 나타났다.
  • Model Soup

    • 서로 다른 checkpoint를 체계적으로 결합하여 modality 전반의 일반화 성능을 추가로 확보하기 위해, 개별 fine-tuning run에서 얻은 **파라미터를 평균(averaging)**한다.
    • 동일 학습 run의 checkpoint 평균, 서로 다른 run의 checkpoint 평균, 다양한 weighted average 등 여러 조합을 실험하였다.

4. Evaluation

  • Gemini Embedding 2를 multimodal 및 unimodal 벤치마크 전반에 걸쳐 엄격하게 평가하였다. 경쟁 모델들이 종종 취약한 task-specific instruction에 의존하는 것과 달리, Gemini Embedding 2는 별도의 prompt engineering 없이도 zero-shot 환경에서 높은 성능을 내는 견고한 통합 latent space를 제공한다.

4.1 Multimodal Retrieval

  • Voyage-3.5-multimodal, Amazon Nova MME, Google의 legacy 모델 multimodalembedding@001과 비교하여 image·text·video modality를 아우르는 다양한 unimodal / cross-modal / multimodal retrieval 벤치마크에서 평가하였다. (아래 Table 1)
  • 평가 구성 : unimodal image는 GUIEC(200,000개 이미지 index에 대한 instance-level retrieval), cross-modal은 MSCOCO·Flickr30k·DOCCI·TextCaps, VQA 기반 retrieval은 EncyclopedicVQA(image+question), text-to-video는 Vatex·MSR-VTT·YouCook2(1 FPS, 최대 32 frame)를 활용하였다.
Task (metric)Gemini Emb. 2Amazon Nova MMEVoyage-3.5-multimodalmultimodalembedding@001
Image→Image (R@1, GUIEC)79.468.669.469.5
Text→Image (R@1, Mean)80.571.675.869.5
Image→Text (R@1, Mean)91.281.685.983.4
Text→Video (NDCG@10, Mean)63.154.049.949.2
Image+Text→Text (R@20, EncyclopedicVQA)71.5-58.6-
Document Retrieval (NDCG@10, ViDoRe V2)64.960.665.528.9
Overall77.268.270.064.1
ModalityV/A/I/TV/A/I/TV/I/TI/T
  • Gemini Embedding 2는 global mean score에서 최고 성능을 기록하였고, unimodal image·text-to-image·image-to-text·text-to-video에서 우위를 보였다. 특히 DOCCI·TextCaps처럼 긴 caption을 다루는 벤치마크에서 강력하였으며, 학습에 in-domain split을 포함하지 않은 Vatex·MSR-VTT·YouCook2 같은 third-party task로도 잘 일반화되었다.
  • Document retrieval(ViDoRe V2)에서는 64.9로 Amazon Nova MME(60.6)를 앞서고 Voyage-3.5-multimodal(65.5)과 근소한 차이를 보였다. Gemini Embedding 2는 전체 Video/Audio/Image/Text modality를 모두 지원하는 두 모델 중 하나로, 동시에 최적화해야 하는 task의 폭을 고려하면 문서 검색 성능이 특히 주목할 만하다.

4.2 MMTEB

  • MMTEB는 250개 이상 언어, 10개 task 유형(Bitext Mining, Classification, Clustering, Instruction Retrieval, Multilabel Classification, Pair Classification, Reranking, Retrieval, STS, Summarization)을 포괄하는 다국어 벤치마크이다.
  • Gemini Embedding 2는 이 텍스트 전용 벤치마크에서도 다른 multimodal 모델을 능가하여, 확장된 multimodal 능력이 순수 텍스트 task 성능을 저해하지 않음을 보였다.
    • MMTEB(Multilingual) Mean(Task) : 69.9 (이전 text-only Gemini Embedding 68.32/68.4 대비 향상)
    • MMTEB(Code) v1 (12개 task, 15개 언어) : 84.0 (이전 76.0 대비 대폭 향상)
    • CoIR (10개 task, 9개 언어) : 82.3 (이전 73.9, voyage-code-3 78.5 대비 우수)
  • 즉, code 관련 벤치마크에서 이전 text-only Gemini Embedding 및 domain-specific 모델(voyage-code-3)보다 상당히 뛰어난 성능을 달성하였다.

4.3 MSEB (오디오 평가)

  • 청각 능력을 평가하기 위해 MSEB(Massive Sound Embedding Benchmark)의 retrieval split을 사용하였다. spoken query가 주어지면 대규모 텍스트 문서 corpus에서 가장 관련 있는 정보를 찾는 task이다.
  • Experimental Setup : 두 입력 방식을 비교한다.
    1. Gemini Embedding 2 w/ ASR : raw audio를 ASR로 먼저 텍스트 전사한 뒤 인코딩하는 cascade baseline.
    2. Gemini Embedding 2 w/ Native Audio : 중간 전사 없이 raw audio를 직접 처리하는 제안 방식.
    • 지표는 mrr@10, retrieval은 PassageInLang(동일 언어)과 PassageCrossLang(교차 언어)으로 구분한다.
Model SetupAveragePassage In-LangPassage Cross-Lang
Gemini Embedding 2 w/ ASR70.4073.5867.55
Gemini Embedding 2 w/ Native Audio73.9975.5872.56
  • native audio 처리가 ASR baseline을 크게 능가(평균 73.99 vs 70.40)하였다. ASR→Retrieval cascade는 error propagation에 취약하여, ASR이 모호한 오디오를 잘못 해석하면 downstream retrieval이 근본적으로 왜곡된 query를 받게 된다.
  • PassageInLang은 +2.0점(75.58 vs 73.58), PassageCrossLang은 +5.01점(72.56 vs 67.55)으로 특히 교차 언어에서 격차가 크게 벌어졌다. 이는 raw audio를 직접 인코딩하여 prosody·intonation·emphasis 등 풍부한 음향 단서를 보존하고, source 언어와 무관하게 semantic feature를 정렬하는 modality-agnostic latent space의 강점을 입증한다.

5. Ablation study

  • Gemini Embedding 2가 다양한 task·언어에서 우수한 성능을 내는 원인을 학습 레시피 관점에서 체계적으로 분석한다.

5.1 특수 도메인(specialized domain) 일반화

  • zero-shot image-to-text retrieval 능력을 microscopy·bioscience(MicroVQA), fine art(ArtCap), astronomy(AstroLLaVA), culinary arts(Recipe1M) 등 도메인별 데이터셋에서 Recall@5(R@5)로 평가하였다.
  • Gemini Embedding 2는 모든 도메인에서 SOTA를 달성하였으며, 기존 baseline 대비 큰 폭의 개선을 보였다.
    • astronomy(AstroLLaVA) R@5 64.4, microscopy(MicroVQA) R@5 79.3으로 baseline 대비 astronomy는 사실상 2배, microscopy는 48% 이상 향상.
    • Recipe1M에서 ingredients 90.2 / instructions 92.1로 90.0 barrier를 돌파, 차선책 SigLIP2-Giant(81.2, 80.4)를 크게 앞섬.
  • 무엇보다 cross-domain consistency가 돋보였다. 기존 모델군은 대상 도메인에 따라 성능 편차가 큰 반면(예: TIPS-G14는 fine art에 강하지만 microscopy에 약함, SigLIP2는 Recipe1M에 강하나 ArtCap에서 급락), Gemini Embedding 2는 도메인에 따른 급격한 변동 없이 예측 가능하고 견고한 정렬을 유지하였다.

5.2 합성 데이터(synthetic data)의 영향

  • Gemini를 활용해 학습 데이터 품질을 높이는 효과를 MTEB Code task로 검증하였다. (아래 Table 5, ablation 모델은 souping 제외)
ModelAverageCodeFeedbackMTCodeFeedbackSTSyntheticText2SQL
Gemini Embedding (text-only)70.556.385.370.0
Gemini Embedding 2 w/o Synthetic73.057.985.575.7
Gemini Embedding 2 w/ Synthetic86.3 (+15.8)92.388.678.1
  • multimodal 모델은 합성 데이터를 추가하기 이전에도 이미 text-only 버전을 능가하였고, Gemini로 생성한 합성 데이터를 추가하자 세 code task 전반(특히 CodeFeedbackMT)에서 뚜렷한 개선을 보여 평균 +15.81점 향상을 달성하였다.

5.3 Fine-Tuning & Pre-Fine-Tuning의 영향

  • PFT checkpoint와 최종 FT checkpoint를 다양한 image·video task에서 비교하였다. FT가 거의 모든 벤치마크에서 PFT를 개선하였으며, image task의 개선은 일관되지만 상대적으로 완만한 반면, 가장 큰 개선은 video 평가에 집중되었다(FT 단계의 추가 video 학습 데이터 덕분).

5.4 In-Domain Video Data의 영향

  • fine-tuning mixture에 targeted in-domain 데이터를 추가하고 1 epoch 학습하면, 수천 step·O(k) 규모의 소량 데이터만으로도 targeted split에서 큰 개선을 얻을 수 있다(예: MSR-VTT 76.1%, Vatex 79.5%).
  • 다만 이 좁은 focus는 out-of-domain task를 소폭 저하시킬 수 있다(예: YouCook2 55.3%로 하락). 흥미롭게도 새로 fine-tune된 weight는 model souping을 통해 base model과 잘 호환되며, 2×base + 1×FT 또는 1×base + 1×FT 같은 단순 interpolation으로 video 성능 이득을 되살리면서 원본 모델의 robustness와 균형을 맞출 수 있었다.

6. Future Work

  • Gemini Embedding 2의 방대한 native multimodal 능력은 intermediate modality 변환 없이도 agentic RAG, video recommendation, interleaved multimodal retrieval 등 다양한 enterprise use case의 가능성을 연다.
  • 성능이 뛰어난 LLM backbone을 활용하는 만큼, search system의 다른 signal(예: ranking)을 임베딩에 포함하는 방향이 retrieval 능력 향상에 유익할 것으로 본다.
  • Agentic RAG 관점에서는 enterprise use case를 위해 임베딩을 fine-tune하는 end-to-end RAG 학습이 유망한 방향으로 제시된다.
  • interleaved multimodal 응용의 범위가 확장됨에 따라, 이러한 신규 능력을 벤치마크할 새로운 평가 프레임워크를 학계가 함께 마련해 줄 것을 제안한다.

7. Conclusion

  • Gemini Embedding 2는 general-purpose representation의 진일보로, 이전 text-only Gemini Embedding을 잇는 SOTA multimodal 후속 모델이다.
  • text·image·audio·video를 아우르는 interleaved 입력의 임의 조합에 대해 임베딩을 매끄럽게 생성하며, Gemini의 multimodal·multilingual·code-centric 기반을 활용해 MSCOCO·Vatex·MMTEB 등 주요 벤치마크에서 landmark 성능을 달성하였다(특히 code retrieval에서 큰 도약).
  • microscopy·astronomy·culinary arts 같은 특수 도메인에서도 뛰어난 versatility를 보였고, native audio 입력이 전통적 ASR을 능가하며 costly task-specific instruction의 필요성을 제거하였다.
  • 결과적으로 Gemini Embedding 2는 고효율 아키텍처로서 cross-data retrieval을 가능케 하며, Gemini와 함께 차세대 agentic system을 구축하는 핵심 인프라를 제공한다.

Reference


My Insight

처음 논문을 볼 땐 technical한 부분이 자세히 표현되길 바랬었다. 그런데 논문을 읽어보니 내용이 너무 간결하여 기대했던 내용이 보이지 않아 아쉬웠다. 특히 multimodal data type의 다양성이 넓어짐에 따라 보편적인 성능을 추론해내는 작업은 상당히 어려운데, 이러한 문제를 해결하기 위한 gemini만의 data/training 노하우를 기대했었던 것 같다. 물론 본인은 modeler가 아니라 함부로 판단하기 어렵지만, 같이 리뷰했던 modeler 지인의 의견이 비슷한 것을 보아 technical report는 역시나인듯 하다.

Comments