Journal de bord · à chaud
Benchmark

DeepSeek V4 Pro est sorti : on l'a noté sur nos six tâches d'agent — et il devient notre chef d'orchestre

La nouvelle version de DeepSeek vient d'arriver sur les fournisseurs d'inférence. Vaut-elle mieux que le modèle qu'on déploie déjà ? On a repris notre banc complet — six vraies tâches d'agent, un juge qui note en aveugle — et on l'a notée deux fois : qualité pure et réactivité. Verdict : elle ne remplace pas flash, elle le commande.

En bref

Le nouveau DeepSeek V4 Pro est 3e en qualité pure— quasi ex æquo avec GLM 5.2, devant flash — mais dernier en direct (27 s par réponse). Alors on donne à chacun son poste : pro orchestre, flash absorbe le volume, GLM 5.2 tranche en juge. Trois rôles, trois modèles.

Thomas Van Dorsselaere ~6 min
Orbes lumineux classés sur un podium, symbolisant les modèles d'IA comparés sur notre banc
Une même question, un juge en aveugle, des mesures réelles

On continue le journal de bord. À l'épisode 2, on a noté neuf modèles sur six vraies tâches d'agent, juge en aveugle : un souverain quasi gratuit finissait deuxième. Depuis, DeepSeek a sorti sa version « Pro » — la question est simple : est-ce qu'elle change notre classement ?

Alors on a repris le même banc : les six tâches figées (post LinkedIn, relance mail, réponse SAV, recherche catalogue, audit visibilité, qualification prospect), le même juge en aveugle, la même note sur 100 — et on a ajouté le nouveau venu dans la colonne. Pas de test au rabais : la vraie méthode de l'épisode 2, appliquée au Pro.

01Le classement — deux notes, parce que deux usages

Un agent n'est pas une seule chose. Un chatbot doit répondre vite, un agent de fond (devis, synthèse, rédaction, orchestration) a le droit de prendre 30 secondes si le résultat est meilleur. Alors on note chaque modèle deux fois, avec le même juge en aveugle : la note « fond » (qualité pure, sans vitesse ni coût) et la note « direct »(réactif, où la vitesse pèse).

#ModèleNote « fond »Note « direct »
1GPT-5.594,682,2
2GLM 5.290,070,4
3deepseek-v4-pronouveau89,868,3
4Claude Sonnet 4.687,873,7
5deepseek-v4-flash87,379,5
6Claude Opus 4.885,372,8
7Mistral Medium 3.584,483,4
8GPT-OSS 120B78,083,6

Juge glm-5.2, en aveugle. deepseek-v4-pro et glm-5.2 ont été mesurés trois fois, les autres une seule — les écarts dans la bande 85-90 sont donc indicatifs. Ce qui est solide : en note « fond », GPT-5.5 décroche en tête, et le Pro monte 3e, quasi ex æquo avec GLM 5.2(89,8 contre 90,0) — devant flash. En note « direct », il plonge dernier, plombé par ses 27 secondes. Deux notes, deux réalités différentes.

02Le détail — chacun sa force, chacun son talon

Un classement global cache le détail. On a mis côte à côte les trois modèles qu'on fait tourner sur le même fournisseur — flash, Pro et GLM — sur chacune des cinq dimensions.

DimensionflashProGLM 5.2
Qualité du français3,73,93,8
Fiabilité (n'invente rien)4,95,05,0
Pertinence / jugement4,74,64,8
Vitesse2,50,71,7
Coût5,03,31,7

Chacun a sa force : flash sur la vitesse et le coût, Pro sur le français (3,9, le meilleur des trois) et la fiabilité, GLM 5.2 sur le jugement (4,8). Mais les talons pèsent lourd : Pro est quatre fois plus lent que flash, et GLM coûte quatre fois plus cher que Pro.

03Le cache et le coût — le vrai critère qu'on oublie

La note « coût » du classement vient d'un calcul, mais on a aussi mesuré le coût réel de chaque appel, cache compris. Le cache change tout : le début du prompt est mis en mémoire, et on ne le repaie pas au tour suivant — c'est ce qui rend un agent multi-tours abordable.

ModèleCoût réel / appelLatence moyenne
deepseek-v4-flash≈ 0,0001 €6,7 s
deepseek-v4-pro≈ 0,0014 €27,4 s
glm-5.2≈ 0,0056 €9,7 s

Deux lectures se dégagent. D'un côté : le Pro coûte 14 fois plus cher que flash (0,0014 € contre 0,0001 €) et répond en 27 secondes contre 6,7 s. De l'autre : GLM 5.2 coûte 4 fois plus cher que le Pro (0,0056 €) — c'est lui le plus cher des trois, pas le Pro. Le cache (149 tokens mis en mémoire par appel pour le Pro) n'absorbe pas ces écarts : c'est le volume de sortie et le prix au token qui font la différence.

Ce que ça dit, plus largement

Le cache, c'est l'angle mort des comparatifs classiques. Un modèle « moins cher au million de tokens » peut revenir plus cher en pratique s'il réfléchit long et génère beaucoup de sortie — ou au contraire presque gratuit si son prompt est servi depuis le cache. On l'avait déjà montré à l'épisode 1 : le coût réel d'un agent, c'est le cache plus le volume de sortie, pas le prix affiché.

04Notre choix : trois rôles, trois modèles

Le Pro ne remplace pas flash — et GLM n'est pas là pour écrire. Chacun a son poste.

Les deux notes disent la même chose : chaque modèle excelle sur un terrain. Pro écrit le meilleur français et décide (3,9 / fiabilité 5,0) ; flash absorbe le volume, rapide et quasi gratuit ; GLM 5.2 est le meilleur juge (pertinence 4,8). Alors on ne force personne : on donne à chacun le rôle qu'il maîtrise.

Notre architecture : deepseek-v4-pro en orchestrateur — il lit, comprend, décide et répartit, et il délègue l'exécution à deepseek-v4-flash. GLM 5.2, lui, est sollicité ponctuellement quand il faut trancher : qualifier un prospect, évaluer un audit, donner un second avis. Trois rôles, trois modèles, chacun au juste prix.

Pour nos clients, une chose est sûre : cet arbitrage n'est pas figé. Le paysage des modèles bouge toutes les semaines, et le bon choix se re-tranche en continu — ce banc sert justement à savoir qui mettre où, mesures à l'appui. Et la seule vraie limite de Pro aujourd'hui n'est ni la qualité ni le prix : c'est la latence. Dès qu'il gagnera en rapidité, il deviendra notre choix par défaut.

Un agent IA qui choisit le bon modèle pour chaque tâche

On déploie des assistants sur-mesure pour PME, avec le bon modèle au bon prix, hébergés en Europe. Parlons de votre cas concret.

Discuter de mon projet

Journal de bord — 12 août 2026. Banc complet repris de l'épisode 2 (six tâches figées), juge glm-5.2 en aveugle, coûts réels mesurés cache compris. deepseek-v4-pro ajouté, mesuré trois fois. Modèles open-weight, servables en région européenne. Scénarios fictifs, sans donnée personnelle. La méthode complète du banc qualité est dans l'épisode 2.