Mehr Quantisierung oder mehr Parameter? Lokale LLMs für KI-Marketing im Benchmark
— 11 Min. Lesezeit

Mehr Quantisierung oder mehr Parameter? Lokale LLMs für KI-Marketing im Benchmark
Kurze Antwort: keins von beidem. Die lange Antwort umfasst 74 Benchmark-Anfragen, vier Quantisierungsstrategien, einen überhitzten Schreibtisch und ein Modell mit 120 Milliarden Parametern, das von etwas geschlagen wird, das nicht einmal ein Viertel seiner Größe hat.
Der Kompromiss bei lokalen LLMs: Parameter vs. Kontext vs. Geschwindigkeit
Sie wissen bereits, warum Sie ein lokales LLM betreiben wollen, statt eines zu mieten. Keine Kosten pro Token bei KI-Marketing-Arbeit mit hundert Entwürfen. Kein vertrauliches Kunden-Briefing, das eine Besichtigungstour durch das Rechenzentrum eines anderen macht. Und unbegrenzte Versuche um 21 Uhr, wenn der Kundenbetreuer entscheidet, die Kampagne solle „inspirierender" wirken.
Also haben Sie gespart, die Kiste gebaut, und dann stehen Sie vor der Frage, die ein ganzes Wochenende Forenlektüre frisst. Die meisten formulieren sie als größeres Modell oder bessere Quantisierung? — und das ist die falsche Frage, weil sie so tut, als würde VRAM nur eine einzige Sache kaufen.
Hier die eigentliche Frage:
Investieren Sie Ihren VRAM in Parameter oder in alles andere?
Parameter sind nicht kostenlos. Sie bezahlen dafür mit den zwei Eigenschaften, die Sie jeden Arbeitstag tatsächlich zu spüren bekommen:
- Kontextfenster. Das 120B-Modell in diesem Test läuft mit 16K Kontext. Das 35B-Modell schafft 131K — achtmal so viel Platz, auf derselben GPU. Das eine kann Ihre Markenrichtlinien, das Recherche-Deck und den Rückblick des letzten Quartals aufnehmen. Das andere passt gerade so die Markenrichtlinien hinein.
- Geschwindigkeit. Das 120B-Modell liefert 15–20 Tokens pro Sekunde. Das 35B-Modell schafft 95–105. Das ist der Unterschied zwischen zwanzig angeforderten Headline-Varianten, die Sie auch bekommen, und zwanzig angeforderten Varianten, während Sie sich in der Zwischenzeit einen Kaffee holen.
Der Kompromiss ist also nicht Quantisierungsqualität gegen Modellgröße. Sondern das hier: Mehr Parameter kaufen Ihnen ein tiefgründigeres Modell, das langsam in einem kleineren Fenster denkt. Weniger Parameter kaufen Ihnen ein oberflächlicheres Modell mit Platz, um alles zu lesen, dafür schnell. Wer gewinnt, hängt vollständig davon ab, ob Ihre Arbeit durch Reasoning oder durch Kontext und Iteration ausgebremst wird.
Das ist die Frage, für die dieser Benchmark gebaut wurde.
Das Testsystem: Core i5-13500, 64 GB RAM, eine RTX 5070 Ti neben einer RTX 4060. Sechzehn und acht Gigabyte VRAM, ein großzügiger Pool an Arbeitsspeicher, und eine CPU, deren Hauptaufgabe dabei ist, das Popcorn durchzureichen.
Vier Kandidaten, vier völlig unterschiedliche Wetten darauf, wie diese Ressourcen am besten investiert werden.
Die Kandidaten: Vier Quantisierungsstrategien für lokale LLMs
| # | Modell (Quant) | Kontext | Geschwindigkeit | Vision |
|---|---|---|---|---|
| 1 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 131.072 | 95–105 tps | Nein |
| 2 | qwen3.6-27b-mtp (Q4_K_M) | 60.000 | 28–40 tps | Ja |
| 3 | gemma-4-31b-it-qat (Q4_K_XL) | 16.384 | 25–35 tps | Ja |
| 4 | gpt-oss-120b (Q8_0) | 16.384 | 15–20 tps | Nein |
LM-Studio-Konfigurationsscreenshots (auf ein Vorschaubild klicken für die volle Größe):
Alle vier sind GGUF-Builds, die über LM Studio bereitgestellt werden. Ein paar Worte zu jedem, denn die Hardware-Geschichte dahinter ist die halbe Miete.
gpt-oss-120b mit Q8_0 hat auf dieser Maschine eigentlich nichts verloren. Hundertzwanzig Milliarden Parameter bei Acht-Bit-Präzision sind rund 120 GB an Gewichten, und im Haus stehen 24 GB VRAM zur Verfügung. Es funktioniert trotzdem, weil es sich um ein Mixture-of-Experts-Modell handelt: Die meisten Expertenschichten dösen im Systemspeicher, und nur die aktiven werden zur 5070 Ti gerufen. Der Preis für diesen Trick sind 15–20 Tokens pro Sekunde. Man kann es sich als ein sehr belesenes Faultier vorstellen.
qwen3.6-35b-a3b-i1 mit Q4_K_S zieht den umgekehrten Trick ab. Fünfunddreißig Milliarden Parameter insgesamt, aber nur etwa 3B aktiv pro Token — so erreicht es 95–105 Tokens pro Sekunde, also etwa das Siebenfache des Tempos des Giganten. Außerdem bringt es ein 131K-Kontextfenster mit, groß genug, um eine ganze Markenrichtlinie zu verschlingen, ohne zu kauen. Der Haken: Es ist reines Textmodell.
qwen3.6-27b-mtp mit Q4_K_M ist auf dem Papier das langweiligste. Siebenundzwanzig Milliarden, dicht, eine ganz normale Quantisierung im Mittelfeld. Es kann dazu Bilder sehen, ein 60K-Kontextfenster halten und mit angenehmen 28–40 tps laufen.
gemma-4-31b-it-qat mit Q4_K_XL wurde quantisierungsbewusst trainiert, das heißt, es kam komprimiert zur Welt, statt erst nachträglich zusammengepresst zu werden — theoretisch das sauberste kleine Modell im Feld. Es sieht Bilder, läuft mit 25–35 tps und ist mit einem 16K-Kontextfenster gefangen.
Der Benchmark: WritingBench für KI-Marketingtexte
Ein Blogpost und ein Bauchgefühl-Check sind kein Benchmark. Es handelte sich um WritingBench, gefiltert auf den englischsprachigen Teilbereich Werbung & Marketing: 74 reale Anfragen über 11 Schreibaufgaben, die Marketingleute jede Woche tatsächlich produzieren.
Markengeschichte. Reiseführer. Social-Media-Content. Multimedia-Skript. Persönlicher Blog. Werbe-Voiceover. Marketing-Kommentar. Produktbeschreibung. Verkaufsbrief. Werbetext. Slogans.
Wenn Sie ein lokales LLM für KI-Marketing-Arbeit bewerten, ist dies eine deutlich bessere Näherung als ein Leaderboard-Durchschnitt, weil es die konkreten Aufgaben bewertet statt allgemeiner Fähigkeiten. Jede Antwort wird anhand von Kriterien pro Anfrage — Relevanz, Kreativität, Überzeugungskraft, Tonalität — auf einer Skala bis 10 bewertet, zuzüglich separater Teilbereiche für Stil-, Format- und Längenkonformität. Letzteres ist wichtiger, als es klingt, denn es misst nicht nur, ob der Text gut ist, sondern ob das Modell das getan hat, was verlangt wurde. Der Bewerter weiß nicht, wer was geschrieben hat. Keine Markentreue, kein Vertrauensvorschuss.
Ergebnisse: Das kleinste lokale LLM gewinnt
| Rang | Modell | Gesamt |
|---|---|---|
| 1 | qwen3.6-27b-mtp (Q4_K_M) | 7,31 |
| 2 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 7,13 |
| 3 | gpt-oss-120b (Q8_0) | 7,07 |
| 4 | gemma-4-31b-it-qat (Q4_K_XL) | 6,75 |
Das 120B-Modell mit Q8_0 — die meisten Parameter und die höchste Präzision im Feld, genau die Konfiguration, die jeder „Kauf einfach mehr VRAM"-Thread auf Reddit implizit empfiehlt — landete auf Platz drei.
Das kleinste Modell im Feld hat gewonnen.
Wären mehr Parameter und höhere Präzision die Antwort, müsste diese Tabelle auf dem Kopf stehen. Das ist sie nicht — also erledigt etwas anderes die eigentliche Arbeit.
Warum das 27B gewonnen hat: Vision, Kontextfenster, Befolgen von Anweisungen
Es kann sehen. Werbung lebt von Bildern: Produktaufnahmen, Markenmaterial, Moodboards, was auch immer der Wettbewerber gerade gepostet hat. Das 27b-mtp schaut sie sich an. Das a3b und das 120B arbeiten blind anhand von Textbeschreibungen, was in dieser Branche einer Art Regieanweisung per Telefon gleichkommt.
Es kann das Briefing im Kopf behalten. Kampagnen-Inputs sind lang — Markenrichtlinien, Recherche-Decks, der Rückblick des letzten Quartals. Der Gewinner hat ein 60K-Kontextfenster. Die beiden geschlagenen Modelle sind bei 16K gedeckelt, und genau dieser Deckel ist der Preis für ihre zusätzlichen Parameter. (Das 131K des a3b ist das größte von allen, was seinen zweiten Platz zu einer eigenen kleinen Geschichte macht. Dazu gleich mehr.)
Es befolgt Anweisungen. Das ist der unglamouröse Punkt, und er entscheidet über mehr echte Arbeit als alles zuvor Genannte. Marketing-Briefings sind voll von „am Ton-Deck orientieren" und „zwei bis drei Sätze, maximal."
| Metrik | 27b-mtp | 35b-a3b | 120b | gemma-4 |
|---|---|---|---|---|
| Formatkonformität | 7,84 | 7,68 | 7,84 | 7,24 |
| Längenkonformität | 7,16 | 6,32 | 6,72 | 6,08 |
Das 120B zieht beim Format mit dem Gewinner gleich. Bei der Länge kommt ihm niemand nahe. Und der Geschwindigkeitsdämon ist trotz seines 131K-Kontexts mit 6,32 der schlimmste Übeltäter im Feld — praktisch das Modell, das auf „gib mir 300 Wörter" mit 900 Wörtern antwortet und dabei den Eindruck erweckt, Ihnen damit einen Gefallen getan zu haben.
Aufgabe für Aufgabe: Kein einziges lokales LLM räumt alles ab
Zoomt man in die einzelnen Aufgaben hinein, wird aus dem Leaderboard plötzlich ein Mannschaftskader.
| Aufgabe | Gewinner | Punktzahl | Zweitplatzierter |
|---|---|---|---|
| Persönlicher Blog | 27b-mtp | 7,83 | 120b · 7,20 |
| Social-Media-Content | 27b-mtp | 7,80 | 120b · 7,57 |
| Reiseführer | 27b-mtp | 7,73 | 120b · 7,67 |
| Multimedia-Skript | 27b-mtp | 7,70 | 35b-a3b · 7,67 |
| Markengeschichte | 27b-mtp | 7,68 | 120b · 7,64 |
| Werbe-Voiceover | 27b-mtp | 7,35 | 35b-a3b · 7,32 |
| Slogans | 27b-mtp | 6,83 | 35b-a3b · 6,63 |
| Marketing-Kommentar | 120b | 7,47 | 27b-mtp · 7,33 |
| Produktbeschreibung | 120b | 7,09 | 35b-a3b · 6,93 |
| Verkaufsbrief | 35b-a3b | 7,15 | 27b-mtp · 6,95 |
| Werbetext | 35b-a3b | 7,04 | 27b-mtp · 7,00 |
Sieben von elf gehen an das 27B. Der Gigant holt sich zwei — und welche zwei, ist die eigentlich interessante Frage. Marketing-Kommentar und Produktbeschreibung: die analytische Arbeit, das Erklären-was-das-ist-und-warum-es-wichtig-ist. Genau dort zahlt sich das Wissen und die Struktur eines großen Modells aus.
Nun ein Blick darauf, wo es am härtesten landet. Slogans, 6,48. Werbetext, 6,44. Beides Schlusslicht oder nahe dran. Das 120B ist ein hervorragender Analyst, der aber keinen Werbejingle schreiben kann, um sein Leben zu retten, und keine noch so hohe Q8_0-Präzision behebt das, weil Präzision nie die fehlende Zutat war.
Das a3b holt sich die beiden kurzen, überzeugungsstarken Aufgaben, Verkaufsbrief und Werbetext — wobei es Letzteres nur um 0,04 vor dem 27B gewinnt, was einem Rundungsfehler mit Medaille gleichkommt. Trotzdem: Ein Modell mit 100 Tokens pro Sekunde ist ein Modell, bei dem Sie zwanzig Varianten anfordern und tatsächlich zwanzig Varianten bekommen, bevor Ihnen die Geduld ausgeht. Genau dort zahlt sich die schnelle, aber oberflächliche Seite des Kompromisses aus: Volumenarbeit, bei der der Gewinn daher kommt, mehr Dinge auszuprobieren, statt länger über eines nachzudenken. Seine einzige echte Sünde bleibt, die Wortzahl zu ignorieren.
Und gemma-4? Hat nichts gewonnen. Letzter beim Gesamtergebnis, Letzter bei Formatkonformität, Letzter bei Längenkonformität, Letzter bei Stilrelevanz mit 6,70. Quantisierungsbewusstes Training ist eine wirklich gute Idee, und trotzdem landete dieses konkrete Modell auf dem vierten Platz in einem Feld von vier. Seine einzige respektable Vorstellung ist die Stilkonsistenz mit 7,25, wo es das 120B knapp schlägt. Das ist die gesamte Highlight-Reihe.
Das Fazit: Wie Sie ein lokales LLM für Marketing-Arbeit wählen
Hören Sie auf, größer oder präziser zu fragen. Fragen Sie stattdessen, wie Ihre tatsächliche Arbeitswoche aussieht — und auf welcher Seite des Kompromisses zwischen Parametern und Kontext-plus-Geschwindigkeit sie landet.
| Wenn Sie meistens… | Nutzen Sie | Weil |
|---|---|---|
| Mit visuellem Material arbeiten — Produktfotos, Markenmaterial, Referenzen | qwen3.6-27b-mtp (Q4_K_M) | Der einzige Top-Scorer mit Augen, beste Konformität im Feld, gewinnt 7 von 11 Aufgaben |
| Schnell brainstormen und über lange Kampagnen-Dokumente iterieren | qwen3.6-35b-a3b-i1 (Q4_K_S) | 95–105 tps und 131K Kontext; beste Verkaufsbriefe und Werbetexte; in jedem Prompt eine „an die Wortzahl halten"-Zeile einplanen |
| Analysieren, beschreiben, kommentieren | gpt-oss-120b (Q8_0) | Gewinnt diese beiden Aufgaben klar — Geduld für 15–20 tps mitbringen |
| Bereits gemma nutzen und sich fragen | gemma-4-31b-it-qat (Q4_K_XL) | Ordentliche Stilkonsistenz, aber verliert jede Aufgabe in diesem Teilbereich; die anderen sind ein kostenloses Upgrade |
Die wahre Antwort ist, dass dies nie eine Entscheidung für ein einziges Modell war. Alle vier GGUF-Dateien passen auf dasselbe Laufwerk, und LM Studio wechselt zwischen ihnen in etwa der Zeit, die man braucht, um das Briefing noch einmal zu lesen. Nutzen Sie das 120B für Strategie und Analyse, das 27b-mtp für alles mit einem angehängten Bild und das a3b für den 21-Uhr-Anruf „wir brauchen in fünf Minuten einen neuen Slogan."
Fazit: Quantisierungsqualität ist nicht Ihr Engpass
Q8_0 hat Q4_K_M nicht geschlagen. 120B hat 27B nicht geschlagen. Sobald man bei Q4 angelangt ist, ist die Quantisierungslücke Hintergrundrauschen im Vergleich zu den Dingen, die tatsächlich entscheiden, ob ein lokales LLM für Marketing-Arbeit taugt:
- Kann es die Assets sehen?
- Kann es das gesamte Briefing in seinem Kontextfenster behalten?
- Tut es, was im Briefing steht?
- Ist es schnell genug, dass Sie es tatsächlich nutzen?
Drei dieser vier Punkte erkauft man sich, indem man seinen VRAM nicht in Parameter steckt. Das ist die gesamte Erkenntnis. Mehr Parameter kauften einen brillanten Analysten, der keinen Slogan schreiben kann, in einem 16K-Fenster, mit Lesegeschwindigkeit. Mehr Präzision kaufte Genauigkeit, die ein Q4 nicht übertreffen konnte. Der Upgrade-Pfad heißt nicht mehr — er heißt passend.
Und ja, ein 120B-Modell durch Auslagerung in den Systemspeicher zum Laufen zu bringen, ist ein Partytrick. Es sind aber auch zwei Goldmedaillen. Nur nach einem Jingle sollte man es besser nicht fragen.
Methodik & Einschränkungen
- Benchmark: WritingBench, englischsprachiger Teilbereich Werbung & Marketing — 74 Anfragen, 11 Schreibaufgabentypen, bewertet auf einer Skala bis 10 durch einen LLM-Bewerter anhand von Kriterien pro Anfrage, zuzüglich separater Teilbereiche für Stil-, Format- und Längenkonformität.
- Hardware: Core i5-13500, 64 GB RAM, RTX 5070 Ti + RTX 4060 (16 + 8 GB VRAM), bereitgestellt über LM Studio.
- Konfigurationen: qwen3.6-27b-mtp (Q4_K_M, 60K Kontext, Vision), qwen3.6-35b-a3b-i1 (Q4_K_S, 131K Kontext), gemma-4-31b-it-qat (Q4_K_XL, 16K Kontext, Vision), gpt-oss-120b (Q8_0, 16K Kontext, MoE-Schichten in den RAM ausgelagert).
- Einschränkungen: Nur Englisch, ein einzelner Bewerter, ein Durchlauf pro Anfrage. Dies sind richtungsweisende Zahlen, kein Dogma — andere GPUs, Quantisierungen oder Prompting-Stile werden sie verschieben. Auch die Abstände an der Spitze sind eng: 0,24 trennt alle drei führenden Modelle, und nur 0,06 trennt Platz zwei von Platz drei. Der Rückstand von gemma mit 0,32 auf Platz drei ist das einzige klar abgesetzte Ergebnis. Behandeln Sie die aufgabenspezifischen Aufschlüsselungen als das eigentliche Signal, nicht die Gesamtrangliste.