EN DIRECT
Les entreprises américaines adoptent de plus en plus l'IA open source04/09/26|Une étude pointe des prix plus élevés dans le mode IA de Google Search04/09/26 · Google|Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Les entreprises américaines adoptent de plus en plus l'IA open source04/09/26|Une étude pointe des prix plus élevés dans le mode IA de Google Search04/09/26 · Google|Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|
🇺🇸 États-Unis generalistSortie juin 2026

Gemma 4 12B

Google
Open-sourceSelf-hostRGPD
Verdict

Une option solide pour l'auto-hébergement et le contrôle total des données.

Présentation

Gemma 4 12B Unified est la version encodeur-free de la famille Gemma 4 de Google DeepMind : texte, image et audio entrent directement dans un seul transformeur décodeur. Elle affiche de bons résultats en raisonnement (GPQA Diamond 78,8 %) et en code (LiveCodeBench 72 %), mais chute nettement sur les tâches les plus dures type HLE (5,2 %). Publiée sous licence Apache 2.0 avec poids ouverts, elle tourne sur un simple laptop, un vrai atout pour les organisations européennes qui veulent garder leurs données sur site.

Profil de compétences

Non communiqué

Forces

  • Open-source et auto-hébergeable

Limites

  • Tarification API non publiée

À qui ça s'adresse

Pour vous si…
  • vous voulez maîtriser vos coûts ou auto-héberger
  • vous avez des contraintes RGPD
À éviter si…

    Cas d'usage idéaux

    • Assistant de code local
    • Agents autonomes avec function calling
    • Analyse multimodale texte-image-audio
    • Déploiement confidentiel sur laptop
    • Support multilingue 140 langues

    Accès & disponibilité

    Auto-hébergeable (poids ouverts)

    Caractéristiques clés

    Contexte
    256K
    Prix entrée
    Prix sortie
    Vitesse
    Prix non auditéBenchmarks non audités

    Confidentialité

    Conforme RGPD

    Faire tourner en local

    Tourne sur un laptop3.2M2k
    QuantizationDisqueRAM / VRAMMatériel type
    Q4 · recommandé6.8 Go9 GoPC 16 Go / Mac M1+ / GPU 8 Go
    Q8 · équilibré12.8 Go16 GoPC 32 Go / Mac 24 Go / RTX 4070 Ti+
    FP16 · qualité max24 Go28 GoMac 64 Go / bi-GPU 24 Go

    Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).

    Déployer

    Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.

    Mémoire estimée · FP16 28 Go · Q4 9 Go

    Serveur OpenAI-compatible pour la production sur GPU NVIDIA.

    pip install vllm
    vllm serve google/gemma-4-12B-it \
      --max-model-len 32768 \
      --tensor-parallel-size 1 \
      --dtype auto
    google/gemma-4-12B-it
    Données avancées · pour experts
    Architecture, modalités, coût détaillé, benchmarks complets
    Architecture
    dense
    Taille
    12B
    Date de coupe
    Entrées
    text
    Sorties
    text
    Licence
    apache-2.0
    Hébergement
    Score d'hallucination
    Coût estimé (API)
    Échange type (~3k entrée / 1k sortie)
    Non communiqué
    1M entrée + 1M sortie
    Non communiqué
    Tous les benchmarks
    Arena Elo
    MMLU
    GPQA
    HumanEval
    SWE-Bench
    MATH

    Modèles similaires