Plus de quantification ou plus de paramètres ? Comparatif de LLM locaux pour le marketing IA
— 13 min de lecture

Plus de quantification ou plus de paramètres ? Comparatif de LLM locaux pour le marketing IA
Réponse courte : ni l'un ni l'autre. La réponse longue implique 74 requêtes de benchmark, quatre stratégies de quantification, un bureau en surchauffe, et un modèle de 120 milliards de paramètres battu par quelque chose de moins d'un quart de sa taille.
Le compromis des LLM locaux : paramètres vs contexte vs vitesse
Vous savez déjà pourquoi vous voulez faire tourner un LLM local plutôt que d'en louer un. Pas de facturation au token pour un travail de marketing IA qui implique une centaine de brouillons. Pas de brief client confidentiel qui fait une visite guidée du data center de quelqu'un d'autre. Et des essais illimités à 21 heures quand le chargé de compte décide que la campagne doit être « plus aspirationnelle ».
Alors vous avez économisé, vous avez monté la machine, et vous êtes tombé sur la question qui dévore un week-end entier de lecture de forums. La plupart des gens la formulent ainsi : modèle plus gros ou meilleure quantification ? — ce qui est le mauvais angle, car cela suppose que la VRAM n'achète qu'une seule chose.
Voici la vraie question :
Dépensez-vous votre VRAM en paramètres, ou en tout le reste ?
Les paramètres ne sont pas gratuits. Vous les payez avec les deux propriétés que vous remarquez réellement chaque jour de travail :
- Fenêtre de contexte. Le modèle 120B de ce test tourne avec 16K de contexte. Le 35B atteint 131K — huit fois plus de marge, sur le même GPU. L'un peut contenir votre charte de marque, le dossier de recherche et le bilan du dernier trimestre. L'autre peut à peine contenir la charte de marque.
- Vitesse. Le 120B produit 15 à 20 tokens par seconde. Le 35B en fait 95 à 105. C'est la différence entre demander vingt variantes de titre et les obtenir, ou en demander vingt et aller se faire un café en attendant.
Le compromis n'est donc pas qualité de quantification contre taille du modèle. C'est ceci : plus de paramètres vous achètent un modèle plus profond qui réfléchit lentement dans une fenêtre plus petite. Moins de paramètres vous achètent un modèle plus superficiel avec de la place pour tout lire, rapidement. Celui qui l'emporte dépend entièrement du fait que votre travail soit bridé par le raisonnement ou par le contexte et l'itération.
C'est la question à laquelle ce benchmark a été conçu pour répondre.
La configuration : Core i5-13500, 64 Go de RAM, une RTX 5070 Ti aux côtés d'une RTX 4060. Seize et huit gigas de VRAM, une réserve généreuse de mémoire système, et un CPU dont le rôle principal dans tout ça est de faire passer le pop-corn.
Quatre concurrents, quatre paris complètement différents sur la façon de dépenser ces ressources.
Les prétendants : quatre stratégies de quantification pour LLM locaux
| # | Modèle (quant) | Contexte | Vitesse | Vision |
|---|---|---|---|---|
| 1 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 131 072 | 95–105 tps | Non |
| 2 | qwen3.6-27b-mtp (Q4_K_M) | 60 000 | 28–40 tps | Oui |
| 3 | gemma-4-31b-it-qat (Q4_K_XL) | 16 384 | 25–35 tps | Oui |
| 4 | gpt-oss-120b (Q8_0) | 16 384 | 15–20 tps | Non |
Captures d'écran de configuration LM Studio (cliquez sur une miniature pour l'afficher en taille réelle) :
Les quatre sont des builds GGUF servis via LM Studio. Un mot sur chacun, car l'histoire matérielle en fait la moitié de l'intérêt.
gpt-oss-120b en Q8_0 n'a rien à faire sur cette machine. Cent vingt milliards de paramètres en précision huit bits, ce sont environ 120 Go de poids, et il y a 24 Go de VRAM disponibles dans la maison. Ça fonctionne quand même, car c'est un modèle mixture-of-experts : la plupart des couches d'experts somnolent dans la mémoire système, et seules les couches actives sont appelées sur la 5070 Ti. Le prix de cette astuce, c'est 15 à 20 tokens par seconde. Un peu comme un paresseux très érudit.
qwen3.6-35b-a3b-i1 en Q4_K_S joue le tour inverse. Trente-cinq milliards de paramètres au total, mais seulement environ 3B actifs par token, ce qui lui permet d'atteindre 95 à 105 tokens par seconde — soit environ sept fois le rythme du géant. Il embarque aussi une fenêtre de contexte de 131K, suffisante pour avaler une charte de marque entière sans mâcher. Le hic : il ne traite que du texte.
qwen3.6-27b-mtp en Q4_K_M est le plus ennuyeux sur le papier. Vingt-sept milliards, dense, une quantification standard dans la moyenne. Il se trouve aussi qu'il voit les images, tient une fenêtre de contexte de 60K, et tourne à un rythme tout à fait vivable de 28 à 40 tps.
gemma-4-31b-it-qat en Q4_K_XL a bénéficié d'un entraînement conscient de la quantification, c'est-à-dire qu'il est né compressé plutôt que compressé après coup — en théorie le petit modèle le plus propre du lot. Il voit les images, tourne à 25–35 tps, et reste coincé avec une fenêtre de contexte de 16K.
Le benchmark : WritingBench pour les textes marketing IA
Un article de blog et un test au feeling, ce n'est pas un benchmark. Il s'agissait de WritingBench, filtré sur le sous-ensemble anglophone Publicité & Marketing : 74 requêtes réelles réparties sur 11 types de tâches d'écriture que les gens du marketing produisent réellement chaque semaine.
Histoire de marque. Guide de voyage. Contenu réseaux sociaux. Script multimédia. Blog personnel. Voix off promotionnelle. Commentaire marketing. Description produit. Lettre de vente. Texte promotionnel. Slogans.
Si vous évaluez un LLM local pour du travail de marketing IA, c'est un bien meilleur indicateur qu'une moyenne de classement, car il évalue les tâches spécifiques plutôt qu'une capacité générale. Chaque réponse est notée sur 10 selon des critères propres à chaque requête — pertinence, créativité, pouvoir de persuasion, ton — plus des sous-ensembles distincts de conformité au style, au format et à la longueur. Ce dernier point compte plus qu'il n'y paraît, car il mesure non seulement si le texte est bon, mais si le modèle a fait ce qu'on lui demandait. Le juge ne sait pas qui a écrit quoi. Pas de fidélité à la marque, pas de bénéfice du doute.
Résultats : le plus petit LLM local l'emporte
| Rang | Modèle | Score global |
|---|---|---|
| 1 | qwen3.6-27b-mtp (Q4_K_M) | 7,31 |
| 2 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 7,13 |
| 3 | gpt-oss-120b (Q8_0) | 7,07 |
| 4 | gemma-4-31b-it-qat (Q4_K_XL) | 6,75 |
Le 120B en Q8_0 — le plus de paramètres et la plus haute précision du lot, la configuration que tout fil Reddit « achetez juste plus de VRAM » recommande implicitement — arrive troisième.
Le plus petit modèle du lot a gagné.
Si plus de paramètres et une précision plus élevée étaient la réponse, ce tableau serait à l'envers. Il ne l'est pas, donc autre chose fait le travail.
Pourquoi le 27B a gagné : vision, fenêtre de contexte, respect des consignes
Il peut voir. La publicité fonctionne avec des images : photos produits, éléments de marque, planches d'ambiance, ce que le concurrent vient de publier. Le 27b-mtp les regarde. L'a3b et le 120B travaillent à l'aveugle à partir de descriptions textuelles, ce qui dans ce secteur revient à faire de la direction artistique par téléphone.
Il peut retenir le brief. Les données d'entrée de campagne sont longues — chartes de marque, dossiers de recherche, bilan du dernier trimestre. Le vainqueur dispose d'une fenêtre de contexte de 60K. Les deux modèles qu'il bat plafonnent à 16K, et ce plafond est exactement ce que leur coûtent leurs paramètres supplémentaires. (Le 131K de l'a3b est le plus grand de tous, ce qui fait de sa deuxième place une histoire à part. On y revient bientôt.)
Il respecte les consignes. C'est le point le moins glamour, et c'est celui qui détermine le plus de travail réel parmi tous ceux cités. Les briefs marketing sont remplis de « respecter la charte de ton » et de « deux à trois phrases, maximum ».
| Métrique | 27b-mtp | 35b-a3b | 120b | gemma-4 |
|---|---|---|---|---|
| Conformité au format | 7,84 | 7,68 | 7,84 | 7,24 |
| Conformité à la longueur | 7,16 | 6,32 | 6,72 | 6,08 |
Le 120B est à égalité avec le vainqueur sur le format. Personne ne l'approche sur la longueur. Et le démon de vitesse, malgré ses 131K de contexte, est le plus mauvais élève du lot avec 6,32 — en pratique, le modèle qui répond « donne-moi 300 mots » avec 900 mots et un air de vous avoir rendu service.
Tâche par tâche : aucun LLM local ne rafle tout
En zoomant sur les tâches individuelles, le tableau cesse d'être un classement et devient un effectif d'équipe.
| Tâche | Vainqueur | Score | Dauphin |
|---|---|---|---|
| Blog personnel | 27b-mtp | 7,83 | 120b · 7,20 |
| Contenu réseaux sociaux | 27b-mtp | 7,80 | 120b · 7,57 |
| Guide de voyage | 27b-mtp | 7,73 | 120b · 7,67 |
| Script multimédia | 27b-mtp | 7,70 | 35b-a3b · 7,67 |
| Histoire de marque | 27b-mtp | 7,68 | 120b · 7,64 |
| Voix off promotionnelle | 27b-mtp | 7,35 | 35b-a3b · 7,32 |
| Slogans | 27b-mtp | 6,83 | 35b-a3b · 6,63 |
| Commentaire marketing | 120b | 7,47 | 27b-mtp · 7,33 |
| Description produit | 120b | 7,09 | 35b-a3b · 6,93 |
| Lettre de vente | 35b-a3b | 7,15 | 27b-mtp · 6,95 |
| Texte promotionnel | 35b-a3b | 7,04 | 27b-mtp · 7,00 |
Sept tâches sur onze reviennent au 27B. Le géant en remporte deux — et lesquelles est ce qui est intéressant. Commentaire marketing et description produit : le travail analytique, celui qui explique ce que c'est et pourquoi c'est important. C'est exactement là où les connaissances et la structure d'un gros modèle rentabilisent leur investissement.
Regardez maintenant où il chute le plus lourdement. Slogans, 6,48. Texte promotionnel, 6,44. Dernier ou presque dans les deux cas. Le 120B est un excellent analyste incapable d'écrire un jingle pour sauver sa vie, et aucune précision Q8_0, aussi élevée soit-elle, n'y changera rien, parce que la précision n'a jamais été l'ingrédient manquant.
L'a3b rafle les deux tâches courtes de persuasion, lettre de vente et texte promotionnel — bien qu'il ne gagne cette dernière que de 0,04 point sur le 27B, ce qui relève de l'erreur d'arrondi déguisée en médaille. Reste qu'un modèle tournant à 100 tokens par seconde est un modèle auquel on peut demander vingt variantes et réellement en obtenir vingt avant de perdre patience. C'est le côté rapide-mais-superficiel du compromis qui paie exactement là où on s'y attend : le travail en volume, où le gain vient du fait d'essayer davantage de choses plutôt que de réfléchir plus longuement à une seule. Son seul vrai péché reste d'ignorer le nombre de mots demandé.
Et gemma-4 ? Il n'a rien gagné. Dernier au score global, dernier en conformité de format, dernier en conformité de longueur, dernier en pertinence de style avec 6,70. L'entraînement conscient de la quantification est une très bonne idée, et pourtant ce modèle en particulier a terminé quatrième sur quatre. Sa seule performance honorable est la cohérence de style à 7,25, où il devance de peu le 120B. C'est tout le résumé des meilleurs moments.
Le verdict : comment choisir un LLM local pour le marketing
Arrêtez de vous demander plus gros ou plus précis. Demandez-vous plutôt à quoi ressemble réellement votre semaine de travail — et de quel côté du compromis paramètres-contre-contexte-et-vitesse elle se situe.
| Si vous faites surtout… | Utilisez | Parce que |
|---|---|---|
| Du travail visuel — photos produits, éléments de marque, références | qwen3.6-27b-mtp (Q4_K_M) | Le seul modèle bien classé doté d'yeux, meilleure conformité du lot, gagne 7 tâches sur 11 |
| Du brainstorming rapide et de l'itération sur de longs documents de campagne | qwen3.6-35b-a3b-i1 (Q4_K_S) | 95–105 tps et 131K de contexte ; meilleures lettres de vente et meilleurs textes promotionnels ; prévoyez une ligne « respecte le nombre de mots » dans chaque prompt |
| De l'analyse, de la description, du commentaire | gpt-oss-120b (Q8_0) | Il remporte ces deux tâches haut la main — armez-vous de patience pour 15–20 tps |
| Déjà utilisateur de gemma et hésitant | gemma-4-31b-it-qat (Q4_K_XL) | Cohérence de style correcte, mais il a perdu chaque tâche de ce sous-ensemble ; les autres sont une mise à niveau gratuite |
La vraie réponse, c'est que ceci n'a jamais été une décision à un seul modèle. Les quatre fichiers GGUF tiennent sur le même disque, et LM Studio bascule de l'un à l'autre en à peu près le temps qu'il faut pour relire le brief. Utilisez le 120B pour la stratégie et l'analyse, le 27b-mtp pour tout ce qui a une image jointe, et l'a3b pour l'appel de 21 heures « il nous faut un nouveau slogan en cinq minutes ».
En résumé : la qualité de quantification n'est pas votre goulot d'étranglement
Le Q8_0 n'a pas battu le Q4_K_M. Le 120B n'a pas battu le 27B. Une fois qu'on est en Q4, l'écart de quantification devient du bruit de fond à côté des éléments qui déterminent réellement si un LLM local est utile pour le travail marketing :
- Peut-il voir les éléments visuels ?
- Peut-il retenir tout le brief dans sa fenêtre de contexte ?
- Fait-il ce que le brief demande ?
- Est-il assez rapide pour que vous l'utilisiez réellement ?
Trois de ces quatre points s'achètent en ne dépensant pas votre VRAM en paramètres. C'est toute la conclusion. Plus de paramètres ont acheté un analyste brillant incapable d'écrire un slogan, dans une fenêtre de 16K, à la vitesse de lecture. Plus de précision a acheté une exactitude incapable de surpasser un Q4. La voie de mise à niveau n'est pas plus — c'est adapté.
Et oui, faire tourner un modèle 120B en le reléguant dans la mémoire système est un tour de passe-passe. C'est aussi deux médailles d'or. Ne lui demandez juste pas d'écrire un jingle.
Méthodologie et réserves
- Benchmark : WritingBench, sous-ensemble anglophone Publicité & Marketing — 74 requêtes, 11 types de tâches d'écriture, notées sur 10 par un juge LLM selon des critères propres à chaque requête, plus des sous-ensembles distincts de conformité au style, au format et à la longueur.
- Matériel : Core i5-13500, 64 Go de RAM, RTX 5070 Ti + RTX 4060 (16 + 8 Go de VRAM), servis via LM Studio.
- Configurations : qwen3.6-27b-mtp (Q4_K_M, contexte 60K, vision), qwen3.6-35b-a3b-i1 (Q4_K_S, contexte 131K), gemma-4-31b-it-qat (Q4_K_XL, contexte 16K, vision), gpt-oss-120b (Q8_0, contexte 16K, couches MoE déportées en RAM).
- Réserves : Anglais uniquement, un seul juge, une seule exécution par requête. Ce sont des chiffres directionnels, pas des vérités absolues — d'autres GPU, quantifications ou styles de prompt les feraient bouger. Les écarts en tête sont aussi serrés : 0,24 point couvre les trois modèles de tête, et seulement 0,06 sépare la deuxième de la troisième place. Le déficit de 0,32 de gemma par rapport à la troisième place est le seul résultat clairement isolé. Considérez les répartitions par tâche comme le vrai signal, pas le classement global.