Mais quantização ou mais parâmetros? Comparativo de LLMs locais para marketing com IA
— 13 min de leitura

Mais quantização ou mais parâmetros? Comparativo de LLMs locais para marketing com IA
Resposta curta: nenhum dos dois. A resposta longa envolve 74 consultas de benchmark, quatro estratégias de quantização, uma mesa superaquecida e um modelo de 120 bilhões de parâmetros sendo derrotado por algo com menos de um quarto do seu tamanho.
O dilema dos LLMs locais: parâmetros vs. contexto vs. velocidade
Você já sabe por que quer rodar um LLM local em vez de alugar um. Sem cobrança por token em trabalhos de marketing com IA que envolvem uma centena de rascunhos. Sem que o brief confidencial de um cliente faça um passeio turístico pelo data center de outra empresa. E tentativas ilimitadas às 21h quando o gerente de contas decide que a campanha precisa ser "mais aspiracional".
Então você economizou, montou a máquina, e caiu na pergunta que consome um fim de semana inteiro lendo fóruns. A maioria formula assim: modelo maior ou quantização melhor? — o que é o enquadramento errado, porque trata a VRAM como se ela só comprasse uma coisa.
Aqui está a pergunta real:
Você gasta sua VRAM em parâmetros, ou em tudo o mais?
Parâmetros não são de graça. Você paga por eles com as duas propriedades que você realmente percebe em cada dia de trabalho:
- Janela de contexto. O modelo 120B neste teste roda com 16K de contexto. O 35B chega a 131K — oito vezes mais espaço, na mesma GPU. Um deles consegue guardar o manual de marca, o dossiê de pesquisa e o retrospecto do último trimestre. O outro mal cabe o manual de marca.
- Velocidade. O 120B produz 15–20 tokens por segundo. O 35B faz 95–105. Essa é a diferença entre pedir vinte variações de título e recebê-las, contra pedir vinte e ir fazer um café enquanto espera.
Então o dilema não é qualidade de quantização contra tamanho do modelo. É isto: mais parâmetros compram um modelo mais profundo, que pensa devagar numa janela menor. Menos parâmetros compram um modelo mais raso, com espaço para ler tudo, rápido. Quem vence depende inteiramente de o seu trabalho estar limitado pelo raciocínio ou pelo contexto e iteração.
Essa é a pergunta para a qual este benchmark foi criado.
O equipamento: Core i5-13500, 64 GB de RAM, uma RTX 5070 Ti ao lado de uma RTX 4060. Dezesseis e oito gigas de VRAM, uma reserva generosa de memória do sistema, e uma CPU cuja principal função nisso tudo é passar a pipoca.
Quatro candidatos, quatro apostas completamente diferentes sobre como gastar esses recursos.
Os concorrentes: quatro estratégias de quantização para LLMs locais
| # | Modelo (quant) | Contexto | Velocidade | Visão |
|---|---|---|---|---|
| 1 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 131.072 | 95–105 tps | Não |
| 2 | qwen3.6-27b-mtp (Q4_K_M) | 60.000 | 28–40 tps | Sim |
| 3 | gemma-4-31b-it-qat (Q4_K_XL) | 16.384 | 25–35 tps | Sim |
| 4 | gpt-oss-120b (Q8_0) | 16.384 | 15–20 tps | Não |
Capturas de tela da configuração do LM Studio (clique numa miniatura para ver em tamanho real):
Todos os quatro são builds GGUF servidos via LM Studio. Uma palavra sobre cada um, porque a história do hardware é metade da diversão.
gpt-oss-120b em Q8_0 não tem nada que fazer nesta máquina. Cento e vinte bilhões de parâmetros em precisão de oito bits são aproximadamente 120 GB de pesos, e há 24 GB de VRAM disponíveis na casa. Funciona mesmo assim, porque é um modelo mixture-of-experts: a maioria dessas camadas de especialistas cochila na RAM do sistema, e só as ativas são chamadas para a 5070 Ti. O preço desse truque é 15–20 tokens por segundo. Pense nele como uma preguiça muito bem lida.
qwen3.6-35b-a3b-i1 em Q4_K_S faz o truque oposto. Trinta e cinco bilhões de parâmetros no total, mas só cerca de 3B ativos por token, e é assim que chega a 95–105 tokens por segundo — cerca de sete vezes o ritmo do gigante. Também carrega uma janela de contexto de 131K, suficiente para engolir um manual de marca inteiro sem mastigar. O problema: é só texto.
qwen3.6-27b-mtp em Q4_K_M é o mais sem graça no papel. Vinte e sete bilhões, denso, uma quantização padrão de meio-termo. Só que também enxerga imagens, mantém uma janela de contexto de 60K, e roda a um ritmo perfeitamente aceitável de 28–40 tps.
gemma-4-31b-it-qat em Q4_K_XL passou por treinamento consciente de quantização, o que significa que nasceu comprimido em vez de ser espremido depois — em teoria, o modelo pequeno mais limpo do grupo. Enxerga imagens, roda a 25–35 tps, e fica preso a uma janela de contexto de 16K.
O benchmark: WritingBench para textos de marketing com IA
Um post de blog e uma checagem de vibe não são um benchmark. Este foi o WritingBench, filtrado para o subconjunto de Publicidade e Marketing somente em inglês: 74 consultas reais em 11 tipos de tarefas de redação que os profissionais de marketing genuinamente produzem toda semana.
História de marca. Guia de viagem. Conteúdo para redes sociais. Roteiro multimídia. Blog pessoal. Locução promocional. Comentário de marketing. Descrição de produto. Carta de vendas. Texto promocional. Slogans.
Se você está avaliando um LLM local para trabalho de marketing com IA, isso é uma referência muito melhor do que uma média de ranking geral, porque avalia as tarefas específicas em vez da capacidade geral. Cada resposta é avaliada numa escala de 10 segundo critérios próprios de cada consulta — relevância, criatividade, poder de persuasão, tom — mais subconjuntos separados de conformidade de estilo, formato e comprimento. Esse último ponto importa mais do que parece, porque mede não só se o texto é bom, mas se o modelo fez o que foi pedido. O juiz não sabe quem escreveu o quê. Sem lealdade de marca, sem benefício da dúvida.
Resultados: o menor LLM local venceu
| Posição | Modelo | Geral |
|---|---|---|
| 1 | qwen3.6-27b-mtp (Q4_K_M) | 7,31 |
| 2 | qwen3.6-35b-a3b-i1 (Q4_K_S) | 7,13 |
| 3 | gpt-oss-120b (Q8_0) | 7,07 |
| 4 | gemma-4-31b-it-qat (Q4_K_XL) | 6,75 |
O 120B em Q8_0 — o maior número de parâmetros e a maior precisão do grupo, a configuração que todo tópico "só compre mais VRAM" do Reddit recomenda implicitamente — ficou em terceiro.
O menor modelo do grupo venceu.
Se mais parâmetros e maior precisão fossem a resposta, essa tabela estaria de cabeça para baixo. Não está, então outra coisa está fazendo o trabalho.
Por que o 27B venceu: visão, janela de contexto, seguimento de instruções
Ele consegue ver. Publicidade funciona com imagens: fotos de produto, ativos de marca, moodboards, o que quer que o concorrente tenha acabado de postar. O 27b-mtp olha para elas. O a3b e o 120B trabalham cegos a partir de descrições em texto, o que nesse setor é como fazer direção de arte por telefone.
Ele consegue reter o brief. Os insumos de campanha são longos — diretrizes de marca, dossiês de pesquisa, o retrospecto do último trimestre. O vencedor tem uma janela de contexto de 60K. Os dois modelos que ele derrota estão limitados a 16K, e esse limite é exatamente o preço que aqueles parâmetros extras cobram. (O 131K do a3b é o maior de todos, o que torna seu segundo lugar uma história à parte. Mais sobre isso logo adiante.)
Ele segue instruções. Este é o ponto menos glamouroso, e é o que decide mais trabalho real do que qualquer um dos anteriores. Briefs de marketing estão cheios de "seguir o tom da marca" e "duas a três frases, no máximo".
| Métrica | 27b-mtp | 35b-a3b | 120b | gemma-4 |
|---|---|---|---|---|
| Conformidade de formato | 7,84 | 7,68 | 7,84 | 7,24 |
| Conformidade de comprimento | 7,16 | 6,32 | 6,72 | 6,08 |
O 120B empata com o vencedor em formato. Ninguém chega perto dele em comprimento. E o demônio da velocidade, com todo o seu contexto de 131K, é o pior infrator do grupo com 6,32 — na prática, o modelo que responde "me dê 300 palavras" com 900 palavras e um ar de ter feito um favor.
Tarefa por tarefa: nenhum LLM local varre tudo
Ao dar zoom nas tarefas individuais, o quadro deixa de ser um ranking e passa a ser um elenco de equipe.
| Tarefa | Vencedor | Pontuação | Vice-líder |
|---|---|---|---|
| Blog pessoal | 27b-mtp | 7,83 | 120b · 7,20 |
| Conteúdo para redes sociais | 27b-mtp | 7,80 | 120b · 7,57 |
| Guia de viagem | 27b-mtp | 7,73 | 120b · 7,67 |
| Roteiro multimídia | 27b-mtp | 7,70 | 35b-a3b · 7,67 |
| História de marca | 27b-mtp | 7,68 | 120b · 7,64 |
| Locução promocional | 27b-mtp | 7,35 | 35b-a3b · 7,32 |
| Slogans | 27b-mtp | 6,83 | 35b-a3b · 6,63 |
| Comentário de marketing | 120b | 7,47 | 27b-mtp · 7,33 |
| Descrição de produto | 120b | 7,09 | 35b-a3b · 6,93 |
| Carta de vendas | 35b-a3b | 7,15 | 27b-mtp · 6,95 |
| Texto promocional | 35b-a3b | 7,04 | 27b-mtp · 7,00 |
Sete das onze tarefas vão para o 27B. O gigante leva duas — e quais duas é a parte interessante. Comentário de marketing e descrição de produto: o trabalho analítico, o de explicar o que isso é e por que importa. É exatamente aí que o conhecimento e a estrutura de um modelo grande valem a pena.
Agora veja onde ele cai com mais força. Slogans, 6,48. Texto promocional, 6,44. Último ou quase em ambos. O 120B é um analista excelente que não consegue escrever um jingle nem para salvar a própria vida, e nenhuma precisão Q8_0 resolve isso, porque a precisão nunca foi o ingrediente que faltava.
O a3b leva as duas tarefas curtas de persuasão, carta de vendas e texto promocional — embora vença esta última por apenas 0,04 sobre o 27B, o que é um erro de arredondamento usando medalha. Ainda assim, um modelo rodando a 100 tokens por segundo é um modelo ao qual você pode pedir vinte variações e realmente receber vinte variações antes de perder o interesse. Esse é o lado rápido-e-raso do dilema pagando dividendos exatamente onde se esperaria: trabalho de volume, em que o ganho vem de tentar mais coisas em vez de pensar mais a fundo sobre uma só. Seu único pecado real continua sendo ignorar a contagem de palavras.
E o gemma-4? Não venceu nada. Último na pontuação geral, último em conformidade de formato, último em conformidade de comprimento, último em relevância de estilo com 6,70. Treinamento consciente de quantização é uma ideia genuinamente boa, e mesmo assim esse modelo em particular terminou em quarto lugar num grupo de quatro. Sua única atuação respeitável é a consistência de estilo com 7,25, onde supera por pouco o 120B. Esse é o resumo completo dos melhores momentos.
O veredito: como escolher um LLM local para trabalho de marketing
Pare de perguntar maior ou mais preciso. Comece a perguntar como é realmente a sua semana de trabalho — e de que lado do dilema parâmetros-versus-contexto-e-velocidade ela cai.
| Se você principalmente… | Use | Porque |
|---|---|---|
| Trabalha com elementos visuais — fotos de produto, ativos de marca, referências | qwen3.6-27b-mtp (Q4_K_M) | O único bem pontuado com "olhos", melhor conformidade do grupo, vence 7 de 11 tarefas |
| Faz brainstorming e itera rápido sobre documentos longos de campanha | qwen3.6-35b-a3b-i1 (Q4_K_S) | 95–105 tps e 131K de contexto; melhores cartas de vendas e textos promocionais; reserve uma linha de "respeite a contagem de palavras" em cada prompt |
| Analisa, descreve, comenta | gpt-oss-120b (Q8_0) | Vence essas duas tarefas com folga — tenha paciência para 15–20 tps |
| Já usa o gemma e está em dúvida | gemma-4-31b-it-qat (Q4_K_XL) | Consistência de estilo decente, mas perdeu todas as tarefas desse subconjunto; os outros são um upgrade gratuito |
A resposta real é que isso nunca foi uma decisão de um único modelo. Os quatro arquivos GGUF cabem no mesmo disco, e o LM Studio alterna entre eles em mais ou menos o tempo que leva para reler o brief. Use o 120B para estratégia e análise, o 27b-mtp para qualquer coisa com imagem anexada, e o a3b para aquela ligação das 21h de "precisamos de um slogan novo em cinco minutos".
Conclusão: a qualidade da quantização não é o seu gargalo
Q8_0 não venceu Q4_K_M. 120B não venceu 27B. Uma vez que você está em Q4, a diferença de quantização vira ruído de fundo perto das coisas que realmente decidem se um LLM local é útil para trabalho de marketing:
- Ele consegue ver os ativos?
- Ele consegue reter o brief inteiro na janela de contexto?
- Ele faz o que o brief pede?
- Ele é rápido o suficiente para que você realmente o use?
Três desses quatro pontos você compra não gastando sua VRAM em parâmetros. Essa é toda a descoberta. Mais parâmetros compraram um analista brilhante incapaz de escrever um slogan, numa janela de 16K, na velocidade de leitura. Mais precisão comprou exatidão que não conseguiu superar um Q4. O caminho de upgrade não é mais — é ajustado.
E sim, fazer um modelo de 120B rodar guardando-o na RAM do sistema é um truque de festa. Também são duas medalhas de ouro. Só não peça um jingle a ele.
Método e ressalvas
- Benchmark: WritingBench, subconjunto de Publicidade e Marketing somente em inglês — 74 consultas, 11 tipos de tarefas de redação, avaliadas numa escala de 10 por um juiz LLM segundo critérios próprios de cada consulta, mais subconjuntos separados de conformidade de estilo, formato e comprimento.
- Hardware: Core i5-13500, 64 GB de RAM, RTX 5070 Ti + RTX 4060 (16 + 8 GB de VRAM), servido via LM Studio.
- Configurações: qwen3.6-27b-mtp (Q4_K_M, contexto 60K, visão), qwen3.6-35b-a3b-i1 (Q4_K_S, contexto 131K), gemma-4-31b-it-qat (Q4_K_XL, contexto 16K, visão), gpt-oss-120b (Q8_0, contexto 16K, camadas MoE descarregadas para a RAM).
- Ressalvas: Somente em inglês, um único juiz, uma execução por consulta. São números direcionais, não verdades absolutas — outras GPUs, quantizações ou estilos de prompt os moveriam. As diferenças no topo também são apertadas: 0,24 cobre os três modelos líderes, e apenas 0,06 separa o segundo do terceiro lugar. O déficit de 0,32 do gemma em relação ao terceiro lugar é o único resultado claramente separado. Trate os recortes por tarefa como o verdadeiro sinal, não o ranking geral.