EN DIRECT
Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|Une étude mesure comment les agents de code choisissent leurs outils tiers03/09/26|GPT-6 Astra d'OpenAI établit un nouveau record sur ARC-AGI-303/09/26 · OpenAI|ESPO : une méthode d'optimisation de prompts plus courte et plus stable que GEPA03/09/26|« Last Translation Benchmark » : un effort collectif pour un référentiel définitif de traduction automatique03/09/26|NVIDIA mise sur l'IA locale à l'IFA 2026 avec les PC RTX Spark et un routeur d'inférence personnel03/09/26 · NVIDIA|Google DeepMind lance WeatherNext 3, son modèle météo IA le plus précis03/09/26 · Google DeepMind|OpenAI lance Daybreak, un programme d'un milliard de dollars pour la cybersécurité des services essentiels03/09/26 · OpenAI|Hcompany lance NeoMME, un encodeur multimodal natif compact pour la recherche documentaire03/09/26 · Hcompany|Playco réduit de 50 % ses corrections manuelles grâce à GPT-6 Astra03/09/26 · OpenAI|Legora analyse 41 documents financiers en quelques minutes avec GPT-6 Astra03/09/26 · OpenAI|Hugging Face reproduit en open source une IA qui peint des aquarelles en code03/09/26 · Hugging Face|Un modèle de 350M de paramètres amélioré en 100 étapes de GRPO pour mieux structurer ses sorties03/09/26|
🇺🇸 États-Unis edgeSortie mars 2025

Gemma 3 1B

Google
Open-sourceSelf-hostRGPD
Verdict

Une option solide pour l'auto-hébergement et le contrôle total des données.

Présentation

Gemma 3 1B est la plus petite déclinaison de la famille Gemma de Google, avec un milliard de paramètres et une fenêtre de contexte de 32 000 tokens. Son atout tient en un mot : la légèreté. Quantifié, il tourne sur un laptop standard, ce qui en fait un choix pertinent pour des déploiements on-premise où les données ne sortent jamais de l'entreprise, sous licence Gemma autorisant l'usage commercial. Sa limite est structurelle : à cette taille, le raisonnement complexe et la profondeur factuelle restent nettement en retrait des modèles plus lourds.

Profil de compétences

Non communiqué

Forces

  • Open-source et auto-hébergeable

Limites

  • Tarification API non publiée

À qui ça s'adresse

Pour vous si…
  • vous voulez maîtriser vos coûts ou auto-héberger
  • vous avez des contraintes RGPD
À éviter si…

    Cas d'usage idéaux

    • Assistant embarqué sur laptop
    • Prototypage local sans cloud
    • Automatisation offline légère
    • Extraction de texte simple
    • Déploiement on-premise sécurisé

    Accès & disponibilité

    Auto-hébergeable (poids ouverts)

    Caractéristiques clés

    Contexte
    32K
    Prix entrée
    Prix sortie
    Vitesse
    Prix non auditéBenchmarks non audités

    Confidentialité

    Conforme RGPD

    Faire tourner en local

    Tourne sur un laptop2.7M1k
    QuantizationDisqueRAM / VRAMMatériel type
    Q4 · recommandé0.6 Go3 GoTout PC/Mac récent
    Q8 · équilibré1.1 Go3 GoTout PC/Mac récent
    FP16 · qualité max2 Go4 GoTout PC/Mac récent

    Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).

    🤗 Hugging Face
    ollama run gemma3:1b

    Déployer

    Commandes prêtes à copier, générées depuis la fiche. Ajuste le contexte et le nombre de GPU à ta machine.

    Mémoire estimée · FP16 4 Go · Q4 3 Go

    Le plus simple pour tester sur un poste. Installe Ollama, puis :

    ollama run gemma3:1b
    google/gemma-3-1b-it
    Données avancées · pour experts
    Architecture, modalités, coût détaillé, benchmarks complets
    Architecture
    dense
    Taille
    1B
    Date de coupe
    Entrées
    text
    Sorties
    text
    Licence
    gemma
    Hébergement
    Score d'hallucination
    Coût estimé (API)
    Échange type (~3k entrée / 1k sortie)
    Non communiqué
    1M entrée + 1M sortie
    Non communiqué
    Tous les benchmarks
    Arena Elo
    MMLU
    GPQA
    HumanEval
    SWE-Bench
    MATH

    Modèles similaires