Échangeons sur vos besoins

Quel modèle d'IA générative pour quel besoin ?

Treize besoins, un arbre. Cliquez un besoin pour le déplier. La mémoire n'est pas un besoin : c'est un filtre qui s'applique à toutes les branches. Tailles en Q4 (défaut Ollama) ; contexte = tokens lus d'un coup (1K ≈ 750 mots). État au 27 août 2026.

13Besoins, chacun avec ses modèles substituables
Radar sourcéPar branche : Arena, GPQA, SWE-bench, Open ASR…
MontagePour chaque besoin, un enchaînement de petits modèles
27 août 2026Date du relevé — les scores évoluent à chaque version
Comment lire cette page. Un modèle de langage ne se choisit pas sur sa taille mais sur le besoin qu'il sert. Pour comprendre ce qu'il y a sous le capot, lire d'abord Comment fonctionne un grand modèle de langage et Comment fonctionne un réseau de neurones. Les licences et les scores ont été vérifiés au 27 août 2026 ; relisez le fichier LICENSE avant tout usage commercial.
Ma mémoire (VRAM ou RAM unifiée) :
Dense — tous les paramètres calculent à chaque mot
MoE — la partie pleine est la fraction active par mot : même mémoire, plusieurs fois plus rapide
Apache 2.0 · MIT · OpenMDWusage commercial gratuit, attribution à conserver
Sous conditionsgratuit sous des seuils fixés par l'éditeur
Non commercialrecherche et usage personnel uniquement
Open-source — poids téléchargeables · recette d'entraînement · données. Aucun modèle ici n'est open source complet (seuls OLMo/Tülu d'AI2) ; « open-weight » est la norme.
Petit et excellent — reste le bon choix même avec beaucoup plus de mémoire
Rapidité vitesse de génération : 5 = plus de 60 tokens/s (MoE ≤ 4B actifs), 2 = 10–20 tokens/s (dense 27–31B sur GPU 24 Go), 1 = quelques tokens/s
Qualité niveau pour ce besoin précis : 5 = frontière, 3 = bon, 1 = limité. Un même modèle a une note différente selon la branche.
Légère Standard Stricte + politique chinoiseCensure — refus intégrés aux poids, tels que constatés par la communauté ; ils varient avec le prompt système et la quantification, et l'API cloud ajoute ses propres filtres. Des variantes « uncensored » (dolphin, r1-1776) existent mais retirent aussi des garde-fous utiles.
dès 24 Gomémoire minimale confortable pour ce tag, contexte compris
Lire les axes des radars : ce qu'une bonne note apporte concrètement
  • Préféré par les humains — des milliers de personnes ont préféré ses réponses en duel à l'aveugle : ton, clarté, utilité perçue. Mesure : Arena texte, arena.ai.
  • Raisonne juste sur du difficile — répond correctement à des questions de niveau doctorat : fiabilité sur les sujets techniques et scientifiques. Mesure : GPQA Diamond.
  • Intelligence générale — score composite indépendant sur raisonnement, code, maths, connaissances. Mesure : Artificial Analysis Index.
  • Mène seul des tâches longues — enchaîne des dizaines d'actions en terminal sans se perdre : autonomie d'agent. Mesure : Terminal-Bench 2.1.
  • Corrige de vrais bugs — résout des tickets réels de dépôts GitHub, tests à l'appui. Mesure : SWE-bench Verified.
  • Corrige des bugs difficiles — même chose sur des tâches longues et multi-fichiers, inédites. Mesure : SWE-bench Pro.
  • Retrouve le bon passage — qualité de la recherche sémantique dans plusieurs langues. Mesure : MMTEB multilingue.
  • Transcrit sans erreur — taux de mots faux : plus c'est haut, moins il y a de fautes. Mesure : Open ASR Leaderboard, WER.
  • Transcrit vite — secondes d'audio traitées par seconde. Mesure : Open ASR Leaderboard, RTFx.
  • Lit de longs documents — nombre de pages absorbées d'un coup sans oublier. Mesure : contexte, fiche modèle.
  • Tient dans peu de mémoire — tourne sur une machine modeste et laisse de la place au contexte. Mesure : taille Q4.
  • Répond vite — peu de paramètres actifs par mot = plus de mots par seconde. Mesure : paramètres actifs.
  • Usage commercial libre — vous pouvez vendre ce que vous produisez avec, sans redevance. Mesure : dépôt officiel.
  • Couvre beaucoup de langues — utilisable au-delà de l'anglais et du français. Mesure : fiche modèle.
  • Récent — intègre les progrès des derniers mois. Mesure : date de sortie.
  • Imite une voix — reproduit un timbre à partir d'un court extrait. Mesure : fiche modèle.
  • Images grandes et nettes — détail suffisant pour l'impression ou le plein écran. Mesure : fiche modèle.
Qu'est-ce que je veux faire ? ·
  • Interroger ma base documentaire (RAG)faire répondre l'IA à partir de mes documents

    Ce besoin s'appelle le RAG et demande deux modèles. Un modèle d'embedding (cartes ci-dessous) : il ne discute pas, il convertit chaque passage en une liste de nombres qui encode son sens, pour retrouver les bons extraits à chaque question. Puis un modèle de chat qui lit ces extraits et rédige : prenez-le dans « Rédiger, analyser, discuter » ; un ★ suffit, le RAG demande du contexte, pas un géant. Un seul embedding par base : en changer oblige à tout réindexer.

    bge-m3MIT
    dès 16 Gojanv. 20241,2 Gocontexte 8K
    Dense 0,6B
    Rapidité très rapideQualité bon
    Variantes : 567m (unique) · F16
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : MTEB multilingue ~63 · Arena : sans objet
    Français et 100 langues. Le choix sûr.
    qwen3-embedding:8bApache 2.0
    dès 16 Gojuin 20255 Gocontexte 32K
    Dense 8B
    Rapidité moyenneQualité frontière
    Variantes : 0.6b · 4b · 8b
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : MTEB multilingue ~70,6, n°1 ouvert
    Plus précis, huit fois plus lourd. 0.6b si la vitesse prime.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Retrouve le bon passageLit de longs documentsTient dans peu de mémoireRépond viteUsage commercial libre
    bge-m3qwen3-embedding:8b
    Retrouve le bon passagerapport Qwen3-EmbeddingLit de longs documentsfiche modèleTient dans peu de mémoiretaille Q4 (Ollama / HF)Répond viteparamètres actifs (fiche modèle)Usage commercial libredépôt officiel
    bge-m359.68K1.2 Go0.6B actifslibre
    qwen3-embedding:8b70.632K5 Go8B actifslibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Lire des images et des documents scannésphotos, PDF scannés, tableaux, OCR
    glm-ocrMIT
    dès 16 Gojanv. 20261 Gocontexte page par page
    Dense 0,9B
    Rapidité très rapideQualité excellent
    Variantes : 0.9b (unique)
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : OmniDocBench, tête des OCR ouverts · Arena : sans objet
    OCR pur : scans, tableaux, formules → texte. Ne raisonne pas.
    gemma4:e4bApache 2.0
    dès 16 Goavr. 20263 Gocontexte 128K
    Dense 4B effectifs
    Rapidité très rapideQualité basique
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena non classé (variante edge)
    Décrire et interroger une image sur un portable ou un téléphone.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité frontière
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440, #40 global · AA Index 52
    Comprendre une image ou une vidéo, pas seulement la lire.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Préféré par les humainsLit de longs documentsTient dans peu de mémoireRépond viteUsage commercial libre
    glm-ocrgemma4:e4bqwen3.8:27b
    Préféré par les humainsarena.ai, 24 août 2026Lit de longs documentsfiche modèleTient dans peu de mémoiretaille Q4 (Ollama / HF)Répond viteparamètres actifs (fiche modèle)Usage commercial libredépôt officiel
    glm-ocrn.d.8K1 Go0.9B actifslibre
    gemma4:e4bn.d.128K3 Go4B actifslibre
    qwen3.8:27b1440262K17 Go27B actifslibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Écouter, transcrire, parleranalyse de voix, transcription, synthèse vocale

    Ollama ne fournit aucun modèle de parole ; seul Gemma 4 sait écouter. La branche regroupe trois fonctions complémentaires, pas concurrentes : on ne choisit pas entre transcrire et parler, on enchaîne les deux. Chaque sous-fonction a ses propres alternatives et son propre radar. Pour la transcription, le critère décisif est la langue : Parakeet et Canary sont plus précis et plus rapides que Whisper sur l'Open ASR Leaderboard, mais Canary ne fait que l'anglais et Parakeet 25 langues européennes. Pour la synthèse, c'est le besoin de clonage ou d'expressivité qui départage.

    1 · Comprendre l'audio audio en entrée, texte en sortie, dans Ollama

    gemma4:e4bApache 2.0
    dès 16 Goavr. 20263 Gocontexte 128K
    Dense 4B effectifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b · 12b (audio) — Q4 · Q8
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena non classé (variante edge)
    Audio en entrée, réponse en texte : commandes, résumé d'un vocal. Portable et téléphone.
    gemma4:12bApache 2.0
    dès 16 Gojuin 20268 Gocontexte 128K
    Dense 12B
    Rapidité moyenneQualité excellent
    Variantes : e2b · e4b · 12b (audio) — Q4 · Q8
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena non classé séparément
    Même capacité d'écoute, compréhension nettement plus fine : réunions longues, accents, plusieurs locuteurs.

    2 · Transcrire parole → texte, hors Ollama

    whisper-large-v3-turboMIT
    dès 16 Gooct. 20241,6 Gofenêtres de 30 s hors Ollama
    Dense 0,8B
    Rapidité rapideQualité excellent
    Variantes : tiny · base · small · medium · large-v3 · turbo
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : Open ASR : ~7,8 % WER · 99 langues
    Le défaut pratique : toutes les langues, 6 Go de mémoire, écosystème le plus large (whisper.cpp).
    parakeet-tdt-0.6b-v3CC-BY-4.0
    dès 16 Goaoût 20252,5 Gojusqu'à 24 min d'un coup hors Ollama
    Conformer 0,6B
    Rapidité très rapideQualité excellent
    Variantes : 0.6b-v3 (multilingue) · 0.6b-v2 (anglais) · 1.1b
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : Open ASR : 6,32 % WER · RTFx 3 332
    Dix fois plus rapide et plus précis que Whisper, 25 langues européennes dont le français ; ni asiatiques ni arabe.
    canary-qwen-2.5bCC-BY-4.0
    dès 16 Gojuin 20258 Golong format hors Ollama
    Conformer + Qwen3-1.7B
    Rapidité moyenneQualité frontière
    Variantes : 2.5b (unique)
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : Open ASR : 5,63 % WER, n°1
    Le plus précis, mais anglais seulement. Sans intérêt pour du français.
    whisper-large-v3MIT
    dès 16 Gonov. 20233,1 Gofenêtres de 30 s hors Ollama
    Dense 1,5B
    Rapidité lenteQualité excellent
    Variantes : large-v3 · distil-large-v3 (anglais)
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : Open ASR : 7,44 % WER · 99 langues
    Un peu plus précis que le turbo, trois fois plus lent. Pour les audios difficiles.
    Transcrire : benchmark sur critères sourcés
    Transcrit sans erreurCouvre beaucoup de languesTranscrit viteTient dans peu de mémoireUsage commercial libre
    whisper-large-v3-turbowhisper-large-v3parakeet-tdt-0.6b-v3canary-qwen-2.5b
    Transcrit sans erreurOpen ASR Leaderboard, HFCouvre beaucoup de languesfiche modèleTranscrit viteOpen ASR LeaderboardTient dans peu de mémoirepoids (HF)Usage commercial libredépôt officiel
    whisper-large-v3-turbo7.8 %992161.6 GoMIT
    whisper-large-v37.44 %99693.1 GoMIT
    parakeet-tdt-0.6b-v36.32 %2533322.5 GoCC-BY-4.0
    canary-qwen-2.5b5.63 %14188 GoCC-BY-4.0

    Rayon = score normalisé 0–100 ; WER : 100 à 5 %, 0 à 10 % ; RTFx et taille en échelle log ; CC-BY-4.0 compte comme libre (attribution obligatoire).

    3 · Parler texte → parole, hors Ollama

    kokoro-82mApache 2.0
    dès 16 Gojanv. 20250,3 Gophrase par phrase hors Ollama
    82M
    Rapidité très rapideQualité excellent
    Variantes : 82M (unique), ~50 voix, 8 langues
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : n°1 TTS Arena à sa sortie
    Voix naturelle sur CPU, temps réel, voix française incluse. Pas de clonage, peu d'émotion.
    chatterbox-multilingualMIT
    dès 16 Gosept. 20252 Gophrase par phrase hors Ollama
    0,5B
    Rapidité rapideQualité frontière
    Variantes : chatterbox · chatterbox-multilingual · turbo
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; usage responsable du clonage de voix à votre charge
    Classement : préféré à ElevenLabs en test à l'aveugle (éditeur)
    Clonage de voix à partir de 5 s d'audio, 23 langues dont le français, expressivité réglable. Filigrane audio intégré.
    orpheus-3bApache 2.0
    dès 16 Gomars 20252,5 Gostreaming hors Ollama
    Dense 3B (base Llama)
    Rapidité moyenneQualité frontière
    Variantes : 3b · 1b · 0.4b · 0.15b · multilingue
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; usage responsable du clonage de voix à votre charge
    Classement : Arena non classé
    Le plus expressif : balises d'émotion (rire, soupir), clonage sans entraînement. Plus lourd, GPU conseillé.
    piperMIT
    dès 16 Go20230,06 Gostreaming hors Ollama
    ~20M (VITS)
    Rapidité très rapideQualité basique
    Variantes : voix par langue et par qualité (low → high)
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : Arena non classé
    Minuscule et instantané (Raspberry Pi), voix françaises disponibles, rendu plus mécanique.
    Parler : benchmark sur critères sourcés
    Couvre beaucoup de languesImite une voixRépond viteTient dans peu de mémoireRécentUsage commercial libre
    kokoro-82mchatterbox-multilingualorpheus-3bpiper
    Couvre beaucoup de languesfiche modèleImite une voixfiche modèleRépond viteparamètres (fiche)Tient dans peu de mémoirepoids (HF)Récentdate de sortieUsage commercial libredépôt officiel
    kokoro-82m8non0.082B0.3 Go19 moisApache 2.0
    chatterbox-multilingual23oui0.5B2 Go11 moisMIT
    orpheus-3b8oui3B2.5 Go17 moisApache 2.0
    piper30non0.02B0.06 Go30 moisMIT

    Rayon = score normalisé 0–100 ; paramètres et taille en échelle log ; fraîcheur : −4 points par mois. Aucun classement de qualité audio comparable n'est publié pour ces quatre modèles : la qualité perçue reste dans les cartes.

  • Chercher sur le webchercher, lire des pages, croiser, citer

    Besoin sous-jacent : un agent. Il faut un modèle entraîné à appeler des outils (tag tools) et un accès au web (API de recherche Ollama, SearXNG, connecteur). Le modèle décide des requêtes, lit les résultats et synthétise avec sources ; le contexte long compte car chaque page consomme 2 à 10K tokens. Une analyse de marché automatisée relève de cette branche.

    gpt-oss:20bApache 2.0
    dès 16 Goaoût 202514 Gocontexte 128K
    MoE 21B · 3,6B actifs
    Rapidité très rapideQualité excellent
    Variantes : 20b · 120b — MXFP4 natif (4 bits sans perte)
    Open-source : poids entraînement données
    Censure : Stricte refus fréquents même sur des sujets limites (médical, sécurité info, fiction violente)
    Classement : Arena non classé séparément · τ²-bench fort
    Entraîné avec un outil de navigation : enchaîne les recherches et cite.
    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global · outils 86 %
    Le plus rapide : veille quotidienne, dizaines de requêtes.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité frontière
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440, #40 global · BenchAlign #6 agentique
    Le plus solide pour lire beaucoup de pages avant de conclure.
    kimi-k3Licence Kimi K3
    cloudjuil. 2026cloudcontexte 1M
    MoE 2,8T · 104B actifs
    Rapidité lenteQualité frontière
    Variantes : cloud uniquement (poids 2,8T sur Hugging Face)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 57, #3 global · #1 Frontend Code Arena
    Recherche agentique longue (centaines d'étapes). Gratuit sous 20 M$ de CA, attribution exigée.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Raisonne juste sur du difficileIntelligence généraleLit de longs documentsRépond viteTient dans peu de mémoireUsage commercial libre
    gpt-oss:20bgemma4:26bqwen3.8:27bkimi-k3
    Raisonne juste sur du difficileéditeurIntelligence généraleArtificial AnalysisLit de longs documentsfiche modèleRépond viteparamètres actifs (fiche modèle)Tient dans peu de mémoiretaille Q4 (Ollama / HF)Usage commercial libredépôt officiel
    gpt-oss:20b71.5n.d.128K3.6B actifs14 Golibre
    gemma4:26b82.3n.d.256K3.8B actifs16 Golibre
    qwen3.8:27bn.d.52262K27B actifs17 Golibre
    kimi-k393.5571024K104B actifscloudconditions

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Faire relire et vérifiercontre-expertise de l'analyse d'un autre modèle

    Règle : le relecteur doit venir d'une famille différente de l'auteur (Qwen, Gemma, gpt-oss, DeepSeek partagent peu de données d'entraînement) ; deux modèles de la même famille reproduisent les mêmes angles morts. Demandez-lui de chercher les erreurs, pas de reformuler.

    bespoke-minicheck:7bCC BY-NC 4.0
    dès 16 Gosept. 20244,7 Gocontexte 32K
    Dense 7B
    Rapidité rapideQualité bon
    Variantes : 7b (unique)
    Open-source : poids entraînement données
    Censure : Sans objet pas de génération libre
    Classement : n°1 LLM-AggreFact · Arena : sans objet
    Vérifie phrase par phrase qu'une affirmation est soutenue par un document source. Licence non commerciale.
    gemma4:31bApache 2.0
    dès 24 Goavr. 202619 Gocontexte 256K
    Dense 31B
    Rapidité lenteQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 451, #31 global, #3 ouvert
    Relecteur si l'analyse vient de Qwen ou DeepSeek.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440, #40 global · AA Index 52
    Relecteur si l'analyse vient de Gemma ou gpt-oss.
    gpt-oss:120bApache 2.0
    dès 64 Goaoût 202565 Gocontexte 128K
    MoE 117B · 5B actifs
    Rapidité moyenneQualité excellent
    Variantes : 20b · 120b — MXFP4 natif (4 bits sans perte)
    Open-source : poids entraînement données
    Censure : Stricte refus fréquents même sur des sujets limites (médical, sécurité info, fiction violente)
    Classement : Arena sous gemma4:31b · Codeforces 2 622
    Lignée OpenAI, la plus indépendante des modèles chinois. En 20b (14 Go) si la mémoire manque.
    deepseek-v4-proMIT
    cloudavr. 2026cloudcontexte 1M
    MoE 1,6T · 49B actifs
    Rapidité moyenneQualité frontière
    Variantes : cloud uniquement (poids 1,6T, ~893 Go)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 44 · #1 LiveCodeBench
    Arbitre de dernier recours, famille DeepSeek, très bon marché.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Préféré par les humainsRaisonne juste sur du difficileIntelligence généraleLit de longs documentsTient dans peu de mémoireUsage commercial libre
    gemma4:31bqwen3.8:27bgpt-oss:120bdeepseek-v4-pro
    Préféré par les humainsarena.ai, 24 août 2026Raisonne juste sur du difficileéditeurIntelligence généraleArtificial AnalysisLit de longs documentsfiche modèleTient dans peu de mémoiretaille Q4 (Ollama / HF)Usage commercial libredépôt officiel
    gemma4:31b145184.3n.d.256K19 Golibre
    qwen3.8:27b1440n.d.52262K17 Golibre
    gpt-oss:120bn.d.80.1n.d.128K65 Golibre
    deepseek-v4-pron.d.n.d.441024Kcloudlibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Rédiger, analyser, discutersynthèse, rédaction, maths, conversation, multilingue

    Le modèle répond en une fois à une question ou un texte. Ce qui compte : culture générale, finesse de langue, multilingue, préférence humaine (Arena, GPQA, AIME). C'est aussi le modèle de chat d'un RAG. Ordonné par mémoire croissante ; au-delà de 24 Go, la mémoire sert surtout à la précision (Q8, BF16) et au contexte, car le catalogue est creux entre 31B et 80B.

    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global, #6 ouvert
    Meilleur rapport intelligence/mémoire. Vision et audio. Même à 48 Go, c'est le choix rapide.
    gpt-oss:20bApache 2.0
    dès 16 Goaoût 202514 Gocontexte 128K
    MoE 21B · 3,6B actifs
    Rapidité très rapideQualité bon
    Variantes : 20b · 120b — MXFP4 natif (4 bits sans perte)
    Open-source : poids entraînement données
    Censure : Stricte refus fréquents même sur des sujets limites (médical, sécurité info, fiction violente)
    Classement : Codeforces 2 516 · Arena non classé séparément
    Raisonneur mathématique, surtout en anglais.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440, #40 global · AA Index 52
    Le plus fin de sa taille. Image et vidéo. Effort de raisonnement sur « medium ».
    gemma4:31bApache 2.0
    dès 24 Goavr. 202619 Gocontexte 256K
    Dense 31B
    Rapidité lenteQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 451, #31 global, #3 ouvert
    Préféré par les humains sur Arena ; très bon multilingue.
    gemma4:31b-q8_0Apache 2.0
    dès 36 Goavr. 202633 Gocontexte 256K
    Dense 31B
    Rapidité lenteQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : identique au Q4 (Arena 1 451), moins d'erreurs fines
    Quantification 8 bits, quasi sans perte, contexte confortable.
    qwen3-next:80bApache 2.0
    dès 48 Gosept. 202550 Gocontexte 262K
    MoE 80B · 3B actifs
    Rapidité rapideQualité excellent
    Variantes : 80b instruct · 80b thinking — Q4 · Q8
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : ≈ Qwen3-235B non-thinking · Arena non classé
    Hybride : contexte très long à vitesse constante. Sans vision.
    qwen3.8:27b-bf16Apache 2.0
    dès 48 Goaoût 202656 Gocontexte 262K
    Dense 27B
    Rapidité très lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440 — poids d'origine
    Aucune quantification : la qualité exacte des benchmarks.
    gpt-oss:120bApache 2.0
    dès 64 Goaoût 202565 Gocontexte 128K
    MoE 117B · 5B actifs
    Rapidité moyenneQualité excellent
    Variantes : 20b · 120b — MXFP4 natif (4 bits sans perte)
    Open-source : poids entraînement données
    Censure : Stricte refus fréquents même sur des sujets limites (médical, sécurité info, fiction violente)
    Classement : Arena sous gemma4:31b · Codeforces 2 622
    Niveau o4-mini, tient dans 80 Go. Anglais surtout.
    deepseek-v4-flashMIT
    > 128 Goavr. 2026~170 Gocontexte 1M
    MoE 284B · 13B actifs
    Rapidité moyenneQualité frontière
    Variantes : 284b (Q4, ~170 Go) · cloud
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 433, #42 global
    Au-delà de 192 Go seulement. Quasi frontière en local.
    kimi-k3Licence Kimi K3
    cloudjuil. 2026cloudcontexte 1M
    MoE 2,8T · 104B actifs
    Rapidité lenteQualité frontière
    Variantes : cloud uniquement (poids 2,8T sur Hugging Face)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 57, #3 global, #1 ouvert · GPQA 93,5
    Le plus fort. Gratuit sous 20 M$ de CA ou 100 M d'utilisateurs ; le plus cher à l'usage.
    deepseek-v4-proMIT
    cloudavr. 2026cloudcontexte 1M
    MoE 1,6T · 49B actifs
    Rapidité moyenneQualité frontière
    Variantes : cloud uniquement (poids 1,6T, ~893 Go)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 44 · #1 LiveCodeBench
    Vingt fois moins cher que Kimi K3, poids téléchargeables.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Préféré par les humainsRaisonne juste sur du difficileIntelligence généraleLit de longs documentsRépond viteTient dans peu de mémoireUsage commercial libre
    gemma4:26bgpt-oss:20bqwen3.8:27bgemma4:31bkimi-k3deepseek-v4-pro
    Préféré par les humainsarena.ai, 24 août 2026Raisonne juste sur du difficileéditeurIntelligence généraleArtificial AnalysisLit de longs documentsfiche modèleRépond viteparamètres actifs (fiche modèle)Tient dans peu de mémoiretaille Q4 (Ollama / HF)Usage commercial libredépôt officiel
    gemma4:26b143882.3n.d.256K3.8B actifs16 Golibre
    gpt-oss:20bn.d.71.5n.d.128K3.6B actifs14 Golibre
    qwen3.8:27b1440n.d.52262K27B actifs17 Golibre
    gemma4:31b145184.3n.d.256K31B actifs19 Golibre
    kimi-k3n.d.93.5571024K104B actifscloudconditions
    deepseek-v4-pron.d.n.d.441024K49B actifscloudlibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Expliquer et visualiserraisonnement, approche systémique, cartes mentales, causalité

    Un modèle de langage ne dessine pas : il écrit le code d'un schéma (Mermaid, Graphviz, Markmap, SVG, D3) qu'un outil rend en image. Le besoin repose donc sur deux capacités : structurer une pensée en nœuds et relations (extraction), puis produire du code de diagramme correct (génération). La pédagogie vient d'une troisième : révéler progressivement, faire manipuler, questionner. Un schéma faux est pire qu'aucun schéma, d'où le contrôle par vision en fin de chaîne.

    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global
    Cartes mentales et schémas simples en Mermaid/Markmap, en quelques secondes. Sait aussi relire l'image rendue.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440, #40 global · AA Index 52
    Le meilleur local pour extraire concepts et causalités d'un long texte, puis les traduire en Graphviz, Mermaid ou SVG. Vérifie le rendu par vision.
    glm-5.2MIT
    cloudjuin 2026cloudcontexte 1M
    MoE 744B · 40B actifs
    Rapidité très rapideQualité frontière
    Variantes : cloud uniquement (poids 744B)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 51 · reconnu pour le front-end
    Explications interactives en HTML/D3 (curseurs, étapes, simulations). Rapide et MIT.
    kimi-k3Licence Kimi K3
    cloudjuil. 2026cloudcontexte 1M
    MoE 2,8T · 104B actifs
    Rapidité lenteQualité frontière
    Variantes : cloud uniquement (poids 2,8T sur Hugging Face)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : #1 Frontend Code Arena · AA Index 57
    Le plus fort pour une visualisation complexe d'un coup (modèle systémique complet, boucles de rétroaction).
    Benchmark sur critères sourcés — modèles substituables uniquement
    Préféré par les humainsIntelligence généraleMène seul des tâches longuesLit de longs documentsRépond viteUsage commercial libre
    gemma4:26bqwen3.8:27bglm-5.2kimi-k3
    Préféré par les humainsarena.ai, 24 août 2026Intelligence généraleArtificial AnalysisMène seul des tâches longueséditeur / AALit de longs documentsfiche modèleRépond viteparamètres actifs (fiche modèle)Usage commercial libredépôt officiel
    gemma4:26b1438n.d.n.d.256K3.8B actifslibre
    qwen3.8:27b14405273.0262K27B actifslibre
    glm-5.2n.d.5181.01024K40B actifslibre
    kimi-k3n.d.5788.31024K104B actifsconditions

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Produire des documents bureautiquesWord, Excel, PowerPoint, PDF

    Comme pour les schémas, le modèle ne « fabrique » pas le fichier : il écrit du code (python-docx, openpyxl, python-pptx) ou du Markdown converti (pandoc, Marp), qu'un outil exécute. Ce qui compte : produire du code correct et des formules Excel justes, respecter un gabarit (styles, charte), et vérifier le rendu, car une mise en page cassée ne se voit pas dans le code. Les contenus eux-mêmes viennent des autres branches (« Chercher sur le web », « Rédiger, analyser, discuter »).

    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global
    Notes, courriers, tableaux simples : Markdown → pandoc en secondes.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Arena 1 440 · Terminal-Bench 2.1 : 73
    Classeurs avec formules et graphiques, présentations à gabarit, documents longs structurés. Relit le rendu par vision.
    glm-5.2MIT
    cloudjuin 2026cloudcontexte 1M
    MoE 744B · 40B actifs
    Rapidité très rapideQualité frontière
    Variantes : cloud uniquement (poids 744B)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 51 · reconnu pour le front-end
    Présentations soignées (mise en page, hiérarchie visuelle) et tableaux de bord.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Préféré par les humainsIntelligence généraleMène seul des tâches longuesLit de longs documentsRépond viteUsage commercial libre
    gemma4:26bqwen3.8:27bglm-5.2
    Préféré par les humainsarena.ai, 24 août 2026Intelligence généraleArtificial AnalysisMène seul des tâches longueséditeur / AALit de longs documentsfiche modèleRépond viteparamètres actifs (fiche modèle)Usage commercial libredépôt officiel
    gemma4:26b1438n.d.n.d.256K3.8B actifslibre
    qwen3.8:27b14405273.0262K27B actifslibre
    glm-5.2n.d.5181.01024K40B actifslibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Générer des imagesillustrations, visuels de présentation, produits, affiches

    Ollama n'héberge pas de modèles d'image ; ce sont des modèles de diffusion à part, lancés avec ComfyUI ou diffusers, tous marqués « hors Ollama ». Le modèle de langage intervient avant (écrire et affiner le prompt) et après (juger par vision si l'image répond au brief). Trois critères départagent : fidélité au prompt, rendu du texte dans l'image (affiches, schémas légendés), et licence commerciale, qui varie beaucoup d'un modèle à l'autre.

    z-image-turboApache 2.0
    dès 16 Gonov. 2025~12 Go1024 px, 8 étapes hors Ollama
    Diffusion 6B
    Rapidité très rapideQualité bon
    Variantes : turbo (unique)
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; filtre de sécurité externe optionnel (nudité, violence)
    Classement : vitesse de référence
    Génération en moins d'une seconde sur GPU : brouillons, variantes, séries.
    flux.2-klein-4bApache 2.0
    dès 16 Gojanv. 2026~13 Go1024–2048 px hors Ollama
    Diffusion 4B
    Rapidité rapideQualité excellent
    Variantes : klein 4B · klein 9B (non commercial) · dev (licence payante)
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; filtre de sécurité externe optionnel (nudité, violence)
    Classement : qualité FLUX en licence libre
    Le meilleur équilibre qualité/vitesse/licence. Le 9B repasse en non commercial.
    qwen-imageApache 2.0
    dès 24 Goaoût 2025~13 Go Q4jusqu'à 2K hors Ollama
    Diffusion 20B
    Rapidité lenteQualité frontière
    Variantes : base · Lightning · Edit-2509 · Layered · 2.0 (7B)
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; filtre de sécurité externe optionnel (nudité, violence)
    Classement : n°1 rendu de texte dans l'image
    Affiches, visuels avec mots lisibles, multilingue. Variantes Edit (retouche) et Lightning (rapide).
    flux.2-devLicence BFL
    dès 36 Gonov. 2025~24 Go FP81024–2048 px hors Ollama
    Diffusion 32B
    Rapidité lenteQualité frontière
    Variantes : dev · pro (API)
    Open-source : poids entraînement données
    Censure : Aucune intégrée pas de refus dans les poids ; filtre de sécurité externe optionnel (nudité, violence)
    Classement : référence qualité ouverte
    Le plus beau rendu, mais usage commercial soumis à licence payante de Black Forest Labs.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Répond viteImages grandes et nettesRécentTient dans peu de mémoireUsage commercial libre
    z-image-turboflux.2-klein-4bqwen-imageflux.2-dev
    Répond viteétapes de diffusion (fiche)Images grandes et nettesfiche modèleRécentdate de sortie (mois)Tient dans peu de mémoiretaille Q4 (Ollama / HF)Usage commercial libredépôt officiel
    z-image-turbo8 étapes1024 px9 mois12 Golibre
    flux.2-klein-4b4 étapes2048 px7 mois13 Golibre
    qwen-image50 étapes2048 px12 mois13 Golibre
    flux.2-dev28 étapes2048 px9 mois24 Goconditions

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

  • Sécuriser et analyser (cybersécurité)alertes, vulnérabilités, logs, code, incidents, conformité

    Il s'agit d'IA pour la sécurité, à visée défensive : comprendre une alerte, trier des vulnérabilités, enrichir un indicateur, relire du code et des configurations, reconstituer un incident, préparer la conformité (ISO 27001, NIS2). Trois points distinguent ce besoin des autres. La souveraineté : logs, code et indicateurs ne doivent pas sortir de votre périmètre, ce qui favorise le local et exclut les clouds chinois pour les données brutes. Les refus : les modèles généralistes refusent de créer des outils offensifs, ce qui est souhaitable, mais gpt-oss refuse aussi souvent d'analyser un malware ; un modèle spécialisé comme Foundation-sec est entraîné pour ça. Et la vérité : un modèle ne connaît pas les CVE d'hier ; les bases externes (NVD, MISP) doivent être des outils, jamais sa mémoire. À ne pas confondre avec la sécurité de vos applications IA (injections de prompt, fuites), couverte par les modèles « guardian » en fin de branche.

    foundation-sec-8b-reasoningApache 2.0
    dès 16 Gojanv. 20265 Gocontexte 128K import HF
    Dense 8B (base Llama 3.1)
    Rapidité rapideQualité excellent
    Variantes : 8b base · 8b-instruct · 8b-reasoning
    Open-source : poids entraînement données
    Censure : Standard, tolérante en défensif entraînée pour analyser attaques et malwares ; refuse d'en créer
    Classement : CTIBench : ≥ Llama 3.1 70B (rapport Cisco)
    Spécialiste : CVE → CWE, techniques ATT&CK, triage d'alertes, rapports d'incident avec raisonnement explicite. Import GGUF dans Ollama.
    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b · 12b · 26b · 31b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global
    Triage rapide d'alertes et de logs en JSON à schéma forcé ; explique une règle, un CVE, une config. Refuse le code offensif.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants ; sans effet sur l'analyse technique. Attention : cloud chinois pour vos logs
    Classement : Arena 1 440 · Terminal-Bench 2.1 : 73
    Revue de code sécurisée, analyse de configurations, corrélation sur de gros volumes de logs. Reste sur votre machine.
    gpt-oss:20bApache 2.0
    dès 16 Goaoût 202514 Gocontexte 128K
    MoE 21B · 3,6B actifs
    Rapidité très rapideQualité bon
    Variantes : 20b · 120b
    Open-source : poids entraînement données
    Censure : Stricte refuse souvent les sujets de sécurité offensive, même à visée défensive : gênant pour l'analyse de malware
    Classement : GPQA 71,5 · Codeforces 2 516
    Bon raisonneur pour l'analyse d'incident, mais refuse fréquemment tout ce qui touche au malware, même pour le comprendre.
    granite4.1-guardianApache 2.0
    dès 16 Gomai 20262 Gocontexte 128K
    Dense 3B (classifieur)
    Rapidité très rapideQualité excellent
    Variantes : granite3-guardian 2b/8b · granite4.1-guardian
    Open-source : poids entraînement données
    Censure : Sans objet classifieur : ne génère pas de texte libre
    Classement : Arena : sans objet
    Sécurité de vos applications IA : détecte injections de prompt, jailbreaks, fuites de données, hallucinations dans un RAG. Alternatives : llama-guard3, gpt-oss-safeguard.
    deepseek-v4-proMIT
    cloudavr. 2026cloudcontexte 1M
    MoE 1,6T · 49B actifs
    Rapidité moyenneQualité frontière
    Variantes : cloud uniquement (poids 1,6T, ~893 Go)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants ; sans effet sur l'analyse technique. Attention : cloud chinois pour vos logs
    Classement : CyberGym 83,3 (n°1) · SWE-bench 80,6
    Le plus fort pour reproduire et analyser une vulnérabilité. Cloud chinois : jamais avec des logs ou du code sensibles non anonymisés.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Connaît les menacesClasse les vulnérabilitésReproduit une vulnérabilitéLit de longs documentsRépond viteDonnées chez vousUsage commercial libre
    foundation-sec-8b-reasoninggemma4:26bqwen3.8:27bgpt-oss:20bdeepseek-v4-pro
    Connaît les menacesCTIBench-MCQA, rapport Cisco (valeur de la version base)Classe les vulnérabilitésCTIBench-RCM (CVE → CWE), rapport CiscoReproduit une vulnérabilitéCyberGymLit de longs documentscontexte, fiche modèleRépond viteparamètres actifsDonnées chez vousexécution locale (fiche)Usage commercial libredépôt officiel
    foundation-sec-8b-reasoning67.4 %75.3 %n.d.128K8B actifsouilibre
    gemma4:26bn.d.n.d.n.d.256K3.8B actifsouilibre
    qwen3.8:27bn.d.n.d.n.d.262K27B actifsouilibre
    gpt-oss:20bn.d.n.d.n.d.128K3.6B actifsouilibre
    deepseek-v4-pron.d.n.d.83.3 %1024K49B actifsnon, cloudlibre

    Les benchmarks cyber (CTIBench, CyberGym) ne sont publiés que pour les modèles spécialisés ou frontière ; pour les généralistes locaux, seules les caractéristiques sont mesurables : c'est en soi une information. « Données chez vous » est décisif en sécurité : un log ou un extrait de code envoyé à un cloud sort de votre périmètre. Point creux = mesure non publiée.

  • Anonymiser et pseudonymiserdonnées personnelles, RGPD, avant partage ou envoi au cloud

    Retirer ou remplacer les données personnelles d'un texte avant de le stocker, le partager ou l'envoyer à un modèle cloud. Deux régimes à ne pas confondre au sens du RGPD : la pseudonymisation remplace les identifiants par des jetons de façon réversible (une table de correspondance permet de revenir au texte d'origine) — la donnée reste personnelle et protégée ; l'anonymisation est irréversible (suppression, généralisation « une ville du Nord », agrégation) et sort la donnée du RGPD. Le principe technique est une cascade : les règles attrapent les formats fixes (IBAN, téléphone, NIR), un détecteur d'entités comme GLiNER attrape noms, adresses et organisations, et le LLM attrape ce que les deux premiers ratent : les quasi-identifiants qui n'identifient qu'en combinaison. Tout tourne en local ; c'est la brique qui rend le cloud utilisable dans « Sécuriser et analyser » et « Interagir avec Proton ».

    gliner-multi-pii-v1Apache 2.0
    dès 16 Gofévr. 20240,6 Gotexte par blocs de 384 tokens hors Ollama
    Encodeur DeBERTa 0,3B
    Rapidité très rapideQualité excellent
    Variantes : gliner-multi-pii-v1 · gliner-multi-v2.1 · gliner-large
    Open-source : poids entraînement données
    Censure : Sans objet détecteur : ne génère pas de texte libre
    Classement : zero-shot NER, référence des détecteurs légers
    Détecte noms, adresses, identifiants, données de santé… à partir d'une liste de types donnée en clair, sans réentraînement. Multilingue. Rapide sur CPU.
    presidioMIT
    dès 16 Go2020, maintenu0,5 Gopar document hors Ollama
    Règles + NER (spaCy / transformers)
    Rapidité très rapideQualité excellent
    Variantes : presidio-analyzer · presidio-anonymizer · presidio-image-redactor
    Open-source : poids entraînement données
    Censure : Sans objet détecteur : ne génère pas de texte libre
    Classement : cadre de référence (Microsoft)
    Cadre complet : détection par règles (IBAN, NIR, email, téléphone, cartes), NER branchable (GLiNER, spaCy), et opérateurs de remplacement, masquage, hachage, chiffrement réversible.
    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b · 12b · 26b · 31b
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438, #41 global
    Les quasi-identifiants que les détecteurs ratent : « le directeur de l'usine de Roubaix », une date d'accident, une combinaison de faits. Non déterministe : en complément, jamais seul.
    gemma4:e4bApache 2.0
    dès 16 Goavr. 20263 Gocontexte 128K
    Dense 4B effectifs
    Rapidité très rapideQualité bon
    Variantes : e2b · e4b
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena non classé
    Seconde passe de vérification : « reste-t-il une donnée personnelle dans ce texte ? » en JSON oui/non avec extrait. Rapide, indépendant du détecteur.
    Benchmark sur critères sourcés — détecteurs substituables
    Répond viteTient dans peu de mémoireCouvre beaucoup de languesDétecte des types nouveauxRésultat reproductibleUsage commercial libre
    gliner-multi-pii-v1presidiogemma4:26b
    Répond viteparamètres actifsTient dans peu de mémoirepoidsCouvre beaucoup de languesfiche modèleDétecte des types nouveauxfiche : zero-shotRésultat reproductiblearchitectureUsage commercial libredépôt officiel
    gliner-multi-pii-v10.3B0.6 Go100ouidéterministeApache 2.0
    presidio0.1B0.5 Go20par règlesdéterministeMIT
    gemma4:26b3.8B16 Go140ouiprobabilisteApache 2.0

    Aucun benchmark de détection de données personnelles n'est commun aux trois (GLiNER publie ses F1 sur CrossNER, Presidio n'en publie pas, le LLM n'est pas évalué comme détecteur) ; les axes sont donc des caractéristiques vérifiables. Le rappel réel se mesure sur vos documents avec un jeu annoté : c'est l'étape 7 du montage.

  • Interagir avec Proton (mail, calendrier, contacts)trier, répondre, planifier, sans sortir du chiffrement

    Ici, le modèle compte moins que le connecteur. Proton chiffre de bout en bout et n'offre pas d'API publique : l'accès passe par Proton Mail Bridge, qui déchiffre localement et expose la boîte en IMAP/SMTP sur votre machine ; des serveurs MCP communautaires (proton-mcp-server, agent-protonsuite) donnent ensuite au modèle des outils lire / chercher / envoyer / déplacer. Le calendrier n'est accessible qu'en lecture (lien ICS de partage) et les contacts par export ; les ponts non officiels (hydroxide, ferroxide) ajoutent CalDAV/CardDAV mais reposent sur une API non documentée qui peut casser et engage votre responsabilité vis-à-vis des conditions d'utilisation. Conséquence directe : le modèle doit être local, sinon le chiffrement de Proton ne protège plus rien. Si un modèle cloud est indispensable pour une tâche, passer d'abord par « Anonymiser et pseudonymiser ».

    Service ProtonAccès officielLectureÉcritureAlternative non officielle
    MailProton Mail Bridge (IMAP/SMTP local, abonnement payant)ouioui : envoyer, déplacer, marquer, supprimerhydroxide, ferroxide (IMAP)
    Calendrierlien de partage ICS (lecture seule)oui, en lecturenon : envoyer une invitation .ics par mail, ou saisie manuelleferroxide (CalDAV, « pour utilisateurs avancés »)
    Contactsexport vCard manueloui, via export périodiquenonhydroxide, ferroxide (CardDAV)
    Drive · PassCLI officiellesouioui
    gemma4:26bApache 2.0
    dès 16 Goavr. 202616 Gocontexte 256K
    MoE 26B · 3,8B actifs
    Rapidité très rapideQualité excellent
    Variantes : e2b · e4b · 12b · 26b · 31b
    Open-source : poids entraînement données
    Censure : Standard refuse armes, malware, sexuel explicite, haine ; neutre en politique
    Classement : Arena 1 438 · usage d'outils 86,4 % (éditeur)
    Trie, résume, propose des réponses, lit l'agenda, en quelques secondes. Le bon orchestrateur : rapide et fiable sur l'appel d'outils.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise sans effet sur l'usage bureautique ; reste en local
    Classement : Arena 1 440 · BenchAlign #6 agentique
    Longs fils de discussion, synthèse d'une semaine de courriels, planification à contraintes multiples.
    gpt-oss:20bApache 2.0
    dès 16 Goaoût 202514 Gocontexte 128K
    MoE 21B · 3,6B actifs
    Rapidité très rapideQualité bon
    Variantes : 20b · 120b
    Open-source : poids entraînement données
    Censure : Stricte refus fréquents sur des sujets limites
    Classement : τ²-bench fort (éditeur)
    Raisonnement solide pour arbitrer un agenda chargé ; rédaction plus sèche en français.
    Benchmark sur critères sourcés — orchestrateurs substituables
    Sait appeler des outilsRépond viteLit de longs documentsTient dans peu de mémoireDonnées chez vousUsage commercial libre
    gemma4:26bqwen3.8:27bgpt-oss:20b
    Sait appeler des outilsfiche éditeur (Gemma 4 : tool use)Répond viteparamètres actifsLit de longs documentscontexteTient dans peu de mémoiretaille Q4Données chez vousexécution localeUsage commercial libredépôt officiel
    gemma4:26b86.4 %3.8B actifs256K16 GoouiApache 2.0
    qwen3.8:27bn.d.27B actifs262K17 GoouiApache 2.0
    gpt-oss:20bn.d.3.6B actifs128K14 GoouiApache 2.0

    Les trois tournent en local, condition nécessaire ici : vos courriels sont déchiffrés par le Bridge sur votre machine et ne doivent pas en sortir. L'appel d'outils n'est publié que par Google pour Gemma 4 ; Qwen et OpenAI publient des benchmarks agentiques non comparables (point creux).

  • Coder, automatiseragent de développement : fichiers, terminal, tests, outils

    Le modèle travaille en boucle : il lit des fichiers, lance des commandes, teste, corrige, sur des dizaines d'étapes. Ce qui compte : fiabilité de l'appel d'outils, contexte long, endurance sans dérive (SWE-bench, Terminal-Bench). Un modèle peut exceller ici et décevoir en conversation, et inversement : gemma4:31b est aimé sur Arena mais moyen en agent ; devstral est l'inverse.

    glm-4.7-flashMIT
    dès 16 Gojanv. 202618 Gocontexte 128K
    MoE 30B · 3B actifs
    Rapidité très rapideQualité bon
    Variantes : 30b-a3b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : SWE-bench Verified ~59 · Arena non classé
    Le plus rapide des agents de code locaux.
    laguna-xs-2.1OpenMDW-1.1
    dès 16 Gojuil. 202620 Gocontexte 262K
    MoE 33B · 3B actifs
    Rapidité très rapideQualité bon
    Variantes : 33b — Q4 · Q8 · BF16 · cloud
    Open-source : poids entraînement données
    Censure : Légère modèle de code, garde-fous de base seulement
    Classement : SWE-bench Multilingual 63 · Arena non classé
    Conçu pour les agents longs ; évaluations publiées trajectoire par trajectoire.
    qwen3.8:27bApache 2.0
    dès 24 Goaoût 202617 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Terminal-Bench 2.1 : 73 · BenchAlign #14/225
    Le 27B de référence pour les agents ; plus lent qu'un MoE.
    devstral-small-2:24bApache 2.0
    dès 24 Godéc. 202515 Gocontexte 256K
    Dense 24B
    Rapidité lenteQualité excellent
    Variantes : 24b — Q4 · Q8 · BF16
    Open-source : poids entraînement données
    Censure : Légère modèle de code, garde-fous de base seulement
    Classement : SWE-bench Verified ~68 · Arena non classé
    Pensé pour les IDE et Mistral Vibe.
    qwen3.8:27b-q8_0Apache 2.0
    dès 36 Goaoût 202629 Gocontexte 262K
    Dense 27B
    Rapidité lenteQualité excellent
    Variantes : 27b — Q4 · Q8 · BF16 · cloud : 2.4T (licence à part)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : Terminal-Bench 2.1 : 73
    En code, la précision Q8 réduit les erreurs de syntaxe et d'API.
    qwen3-coder-next:80bApache 2.0
    dès 48 Gofévr. 202650 Gocontexte 262K
    MoE 80B · 3B actifs
    Rapidité rapideQualité excellent
    Variantes : 80b — Q4 · Q8
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : onyx self-hosted : classe B · Arena non classé
    Agent de code local rapide sur de gros dépôts.
    laguna-s-2.1OpenMDW-1.1
    dès 64 Gojuil. 2026~70 Gocontexte 1M
    MoE 118B · 8B actifs
    Rapidité moyenneQualité excellent
    Variantes : 118b — Q4 · Q8 · cloud
    Open-source : poids entraînement données
    Censure : Légère modèle de code, garde-fous de base seulement
    Classement : Terminal-Bench 2.1 : 70,2 (#11) · SWE-bench Pro 59
    Bat des modèles 10× plus gros ; trajectoires publiées.
    devstral-2:123bApache 2.0
    dès 64 Godéc. 202570 Gocontexte 256K
    Dense 123B
    Rapidité très lenteQualité excellent
    Variantes : 123b — Q4 · Q8 · cloud
    Open-source : poids entraînement données
    Censure : Légère modèle de code, garde-fous de base seulement
    Classement : SWE-bench Verified ~72 · onyx : classe C
    Dense, donc lent hors GPU professionnel.
    deepseek-v4-proMIT
    cloudavr. 2026cloudcontexte 1M
    MoE 1,6T · 49B actifs
    Rapidité moyenneQualité frontière
    Variantes : cloud uniquement (poids 1,6T, ~893 Go)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : SWE-bench Verified 80,6 · Terminal-Bench 87,9
    Le meilleur rapport qualité/prix de la frontière.
    glm-5.2MIT
    cloudjuin 2026cloudcontexte 1M
    MoE 744B · 40B actifs
    Rapidité très rapideQualité frontière
    Variantes : cloud uniquement (poids 744B)
    Open-source : poids entraînement données
    Censure : Standard + politique chinoise Tiananmen, Taïwan, Xinjiang, dirigeants : refus ou réponse officielle. Atténuée en local, forte sur l'API
    Classement : AA Index 51 · SWE-bench Pro 62,1
    Trois fois plus rapide que ses pairs.
    Benchmark sur critères sourcés — modèles substituables uniquement
    Corrige de vrais bugsMène seul des tâches longuesCorrige des bugs difficilesLit de longs documentsRépond viteTient dans peu de mémoireUsage commercial libre
    glm-4.7-flashqwen3.8:27bdevstral-small-2:24blaguna-s-2.1deepseek-v4-proglm-5.2
    Corrige de vrais bugséditeur (Qwen : valeur 3.6-27B)Mène seul des tâches longueséditeur / AACorrige des bugs difficileséditeur (Qwen : 3.6-27B)Lit de longs documentsfiche modèleRépond viteparamètres actifs (fiche modèle)Tient dans peu de mémoiretaille Q4 (Ollama / HF)Usage commercial libredépôt officiel
    glm-4.7-flash59.2n.d.n.d.128K3B actifs18 Golibre
    qwen3.8:27b77.273.053.5262K27B actifs17 Golibre
    devstral-small-2:24b68.0n.d.n.d.256K24B actifs15 Golibre
    laguna-s-2.1n.d.70.259.41024K8B actifs70 Golibre
    deepseek-v4-pro80.687.9n.d.1024K49B actifscloudlibre
    glm-5.2n.d.81.062.11024K40B actifscloudlibre

    Seuls les modèles interchangeables pour ce besoin sont comparés ; les briques complémentaires (vérificateur, OCR seul) restent dans les cartes. Rayon = score normalisé 0–100 (Arena : 1 350→1 500 ; AA Index : /60 ; benchmarks en % ; contexte, taille et paramètres actifs en échelle log ; licence : libre 100, conditions 60, non commerciale 20). Un point creux au centre = mesure non publiée, pas un mauvais score.

Faire travailler les LLM avec les autres algorithmes d'IA

Un LLM comprend le langage, décide et explique, mais il compte mal, prévoit mal les chiffres, ne voit pas une vidéo en temps réel et ne trouve jamais un optimum. Les algorithmes spécialisés — réseaux de neurones de vision, modèles de séries temporelles, arbres de décision, graphes, solveurs — font chacun une chose vite et de façon reproductible, mais ne savent ni lire une demande en français ni rédiger une conclusion. L'intérêt est de les assembler : l'algorithme perçoit ou calcule, le LLM interprète, commande ou entraîne. La règle qui évite la plupart des erreurs : tout ce qui est déterministe ou chiffré revient à l'algorithme ; tout ce qui est linguistique ou contextuel revient au LLM.

LLMcomprend, décide, expliquegemma4 · qwen3.8 · gpt-ossVisionYOLO, SAM 2, DINOSéries temporellesChronos, TimesFM, ProphetTabulaireXGBoost, scikit-learnGraphesNeo4j, GNN, GraphRAGOptimisationOR-Tools, Monte-Carlo, RLPetits classifieursDeBERTa, GLiNERFlèches dans les deux sens : l'algorithme perçoit ou calcule, le LLM interprète, commande ou entraîne

Six façons de les brancher

1. Outil appelé par le LLM

Le LLM décide quand appeler l'algorithme et avec quels paramètres, via l'API tools d'Ollama ou un serveur MCP ; le code exécute et renvoie un résultat structuré.

« Compte les palettes sur cette vidéo » → appel YOLO → 47 → phrase de réponse.

2. Perception → langage

L'algorithme transforme un signal (image, capteur, tableau) en données structurées ; le LLM les lit, les met en contexte et rédige.

Détections YOLO horodatées → compte rendu d'inspection.

3. LLM → étiquettes → petit modèle

Le LLM produit des données d'entraînement (étiquetage faible) ; un modèle 100× plus petit apprend dessus et remplace le LLM en production, rapide et déterministe.

10 000 tickets étiquetés par gemma4 → classifieur DeBERTa en 20 ms.

4. LLM comme codeur de pipelines

Le LLM écrit et corrige le code d'entraînement ou d'inférence (scikit-learn, OR-Tools), l'exécute, lit les métriques et itère : AutoML conversationnel.

« Prédis le churn » → notebook XGBoost, validation croisée, rapport.

5. Explication des sorties

Un modèle opaque (score, cluster, sous-graphe) est traduit en langage clair par le LLM à partir de ses attributions (SHAP, attention).

Score de risque 0,82 → « trois facteurs expliquent 70 % du score… ».

6. Cascade

Le petit modèle spécialisé traite le volume ; le LLM n'intervient que sur les cas incertains ou nouveaux, selon un seuil de confiance.

Classifieur sûr à 95 % → LLM sur les 5 % restants.

Concrètement, chaque algorithme est enveloppé dans une fonction Python exposée au LLM comme outil (API tools d'Ollama ou serveur MCP), avec un schéma d'entrée et de sortie en JSON. Le LLM ne voit jamais les poids de YOLO ni le code de XGBoost : il voit une fonction detecter_objets(video, classes) et son résultat. Trois précautions : imposer des sorties structurées (schéma forcé) à chaque frontière ; mesurer la latence de chaque brique, car un LLM appelé cent fois par seconde n'est jamais la bonne architecture ; et garder un jeu de test par brique, pas seulement pour l'ensemble.

Six familles d'algorithmes, trois cas d'usage chacune

Vision par ordinateurYOLO11 / YOLO26 (détection, suivi), SAM 2 (segmentation), DINOv3 (caractéristiques)

Un détecteur YOLO traite 100 images par seconde avec des boîtes fiables et reproductibles ; un modèle de vision-langage (gemma4, qwen3.8) comprend une scène mais met une seconde par image et ne compte pas de façon fiable. On combine donc : YOLO perçoit, le LLM interprète.

  1. Contrôle qualité d'une chaîne de tri — YOLO détecte les contaminants (plastiques, verre) dans un flux de biodéchets et les compte par lot ; gemma4:26b reçoit les comptages horodatés, rédige le rapport de conformité du jour et déclenche une alerte quand le taux dépasse le seuil contractuel. Motif 2.
  2. Inventaire et inspection par vidéo — Une caméra filme un entrepôt ; YOLO + suivi comptent palettes et références, écrivent dans une base ; qwen3.8:27b répond ensuite en langage naturel (« qu'est-ce qui manque par rapport au bon de livraison ? ») en générant la requête SQL. Motifs 1 et 2.
  3. Détection d'incident et compte rendu — YOLO repère une chute, une intrusion ou un départ de feu (détection rapide, en continu) ; seules les images de l'événement sont envoyées à gemma4:12b, qui décrit la scène, évalue la gravité et rédige la main courante. Le LLM n'analyse jamais le flux complet : trop lent et trop cher. Motif 6.

Prévision de séries temporellesChronos-2, TimesFM 2.5 (modèles de fondation), Prophet, N-HiTS, autoencodeurs pour anomalies

Les LLM prévoient mal les chiffres : ils ne voient pas la saisonnalité et inventent des tendances. Les modèles de séries temporelles font ce travail avec des intervalles de confiance ; le LLM sert à choisir, lancer, puis expliquer.

  1. Prévision des volumes de collecte — Chronos-2 prévoit les tonnages par tournée sur 8 semaines à partir de l'historique et du calendrier ; qwen3.8:27b compare la prévision au réalisé chaque lundi, explique les écarts en croisant avec les événements connus (RAG sur les notes d'exploitation) et rédige la note de planification. Motifs 2 et 5.
  2. Agent de prévision — L'utilisateur décrit son besoin ; qwen3.8:27b choisit entre Prophet et TimesFM selon la longueur de l'historique, écrit le code, lance le backtest, lit les métriques (MAPE) et itère jusqu'à un seuil, puis livre le modèle retenu avec sa justification. Motif 4.
  3. Maintenance prédictive — Un autoencodeur entraîné sur les capteurs d'une presse signale une anomalie (erreur de reconstruction) ; gemma4:26b reçoit l'anomalie, retrouve dans le journal de maintenance les interventions passées sur cet équipement et propose trois causes classées par vraisemblance. L'anomalie est détectée par le réseau, jamais par le LLM. Motifs 2 et 5.

Apprentissage tabulaire classiqueXGBoost, LightGBM, régression logistique, k-means, SHAP

Sur des données en colonnes (clients, transactions, capteurs), un modèle à arbres reste plus précis, plus rapide et auditable qu'un LLM. Le LLM apporte ce que les arbres n'ont pas : lire du texte, expliquer, nommer.

  1. Scoring expliqué au conseiller — XGBoost calcule un score de risque ou de churn ; les valeurs SHAP indiquent les facteurs ; gemma4:26b les traduit en trois phrases pour le conseiller, dans le ton de l'entreprise, sans jamais modifier le score. Motif 5.
  2. Variables extraites des textesqwen3.8:27b lit contrats, mails et comptes rendus et en extrait des champs structurés (durée d'engagement, motif de réclamation, ton) en JSON à schéma forcé ; ces champs deviennent des colonnes du modèle tabulaire, qui gagne en précision. Motif 2 inversé : langage → tableau.
  3. Segmentation nommée — Les clients ou tickets sont vectorisés par bge-m3 et regroupés par k-means ; pour chaque groupe, le LLM lit vingt exemples et produit un nom, une description et une action recommandée. Le regroupement est statistique, l'interprétation est linguistique. Motifs 2 et 5.

Graphes de connaissances et réseaux de neurones sur graphesNeo4j, GraphRAG, GNN (PyTorch Geometric)

Un graphe répond aux questions à plusieurs sauts (« qui détient qui, qui fournit qui ») que le RAG par similarité rate ; un GNN détecte des structures (réseaux de fraude, communautés). Le LLM construit le graphe et le raconte.

  1. Cartographie d'un marchéqwen3.8:27b extrait des articles et rapports les entités (entreprises, dirigeants, contrats, financements) et leurs relations ; le graphe Neo4j permet ensuite des questions comme « quels concurrents de Moulinot partagent un investisseur ? », que le LLM traduit en requête Cypher puis en réponse. Motifs 1 et 2.
  2. Détection de réseaux suspects — Un GNN repère dans les transactions ou les connexions un sous-graphe anormal (motif de fraude, mouvement latéral en cyber) ; foundation-sec-8b-reasoning ou gemma4:26b explique le sous-graphe à l'analyste : qui, quoi, dans quel ordre. Motif 5.
  3. Recommandation justifiée — Un modèle de recommandation par graphe propose des produits ou des documents ; le LLM rédige pour chaque proposition une justification personnalisée à partir des chemins du graphe (« parce que vous avez consulté… »). Motif 5.

Optimisation, simulation et apprentissage par renforcementOR-Tools, solveurs MILP, simulation Monte-Carlo, Gymnasium

Un solveur trouve l'optimum garanti d'un problème bien posé ; un LLM ne le trouve jamais mais sait poser le problème à partir d'une demande en français et interpréter la solution. En contrôle temps réel, le LLM ne pilote pas : il définit et audite.

  1. Tournées de collecte — « Réorganise les tournées pour absorber 15 % de volume en plus sans camion supplémentaire » : qwen3.8:27b traduit en modèle de routage (contraintes, capacités, fenêtres horaires) pour OR-Tools, lance le solveur, vérifie que la solution respecte les contraintes et l'explique au planificateur. Motifs 1 et 4.
  2. Scénarios de marché par simulation — Pour une analyse de marché, le LLM propose des hypothèses (croissance, prix, réglementation) avec leurs distributions ; une simulation Monte-Carlo en code produit les scénarios ; gemma4:31b en rédige la synthèse avec les intervalles, puis qwen3.8:27b relit la cohérence des hypothèses (contre-expertise). Motifs 4 et 5.
  3. Politique de contrôle apprise — Un agent par renforcement apprend à piloter un procédé (chauffage, tri, stockage d'énergie) dans un simulateur ; le LLM sert à formuler la fonction de récompense et les contraintes de sécurité, puis à auditer les épisodes anormaux en langage clair. Le LLM n'est jamais dans la boucle de commande à la milliseconde. Motifs 4 et 5.

Petits modèles de langage spécialisésDeBERTa, ModernBERT (classification), GLiNER (entités), modèles de sentiment

Un encodeur de 100 à 400 millions de paramètres classe un texte en 20 ms, de façon déterministe et pour un coût nul, mais ne sait faire que la tâche apprise. Le LLM sert à l'entraîner, puis à traiter ce qu'il ne sait pas faire.

  1. Classification de tickets à haut volumegemma4:26b étiquette 10 000 tickets historiques (motif, urgence) ; un DeBERTa fine-tuné sur ces étiquettes traite le flux en production ; les tickets où sa confiance est sous 90 % remontent au LLM. Motifs 3 et 6.
  2. Anonymisation avant le cloud — GLiNER repère noms, adresses, identifiants dans les logs ou documents ; ils sont remplacés par des jetons avant tout envoi à un modèle cloud (deepseek-v4-pro, kimi-k3), et rétablis dans la réponse. C'est la brique qui rend le recours au cloud compatible avec la souveraineté exigée en cybersécurité ; montage complet dans « Anonymiser et pseudonymiser ». Motif 6.
  3. Veille par filtrage puis lecture — Un classifieur de pertinence entraîné sur vos décisions passées filtre les milliers d'articles quotidiens ; seuls les 50 retenus sont lus et synthétisés par qwen3.8:27b. Sans le filtre, le LLM coûterait cent fois plus pour le même résultat. Motifs 3 et 6.