Whisper large-v3
Une option solide pour l'auto-hébergement et le contrôle total des données.
Présentation
Whisper large-v3 est un modèle encodeur-décodeur de reconnaissance vocale et de traduction, entraîné sur des millions d'heures d'audio faiblement supervisé, ce qui lui donne une bonne robustesse multilingue en zero-shot. Ses poids ouverts sous licence Apache 2.0 et son tier matériel « laptop » en font un choix pragmatique pour un déploiement on-premise en Europe, données comprises. Sa limite structurelle : un champ réceptif de 30 secondes qui oblige à des algorithmes de découpage pour les audios longs, avec un compromis vitesse/précision à gérer.
Profil de compétences
Non communiqué
Forces
- Open-source et auto-hébergeable
Limites
- Tarification API non publiée
À qui ça s'adresse
- vous voulez maîtriser vos coûts ou auto-héberger
- vous avez des contraintes RGPD
Cas d'usage idéaux
- Transcription de réunions
- Sous-titrage multilingue
- Traduction audio vers texte
- Assistants vocaux on-premise
- Archivage de contenus audio
Accès & disponibilité
Caractéristiques clés
Confidentialité
Faire tourner en local
| Quantization | Disque | RAM / VRAM | Matériel type |
|---|---|---|---|
| Q4 · recommandé | 0.9 Go | 3 Go | Tout PC/Mac récent |
| Q8 · équilibré | 1.7 Go | 4 Go | Tout PC/Mac récent |
| FP16 · qualité max | 3.1 Go | 5 Go | Tout PC/Mac récent |
Estimations pour un contexte modéré. Un long contexte augmente la RAM nécessaire (KV cache).
Déployer
Commandes prêtes à copier, générées depuis la fiche. Ajustez le contexte et le nombre de GPU à votre machine.
Serveur OpenAI-compatible pour la production sur GPU NVIDIA.
pip install vllm
vllm serve openai/whisper-large-v3 \
--max-model-len 32768 \
--tensor-parallel-size 1 \
--dtype autoDonnées avancées · pour expertsArchitecture, modalités, coût détaillé, benchmarks complets▾
| Arena Elo | — |
| MMLU | — |
| GPQA | — |
| HumanEval | — |
| SWE-Bench | — |
| MATH | — |