Preparing your experience...

¿Más cuantización o más parámetros? Comparativa de LLM locales para marketing con IA

— 13 min de lectura

¿Más cuantización o más parámetros? Comparativa de LLM locales para marketing con IA

¿Más cuantización o más parámetros? Comparativa de LLM locales para marketing con IA

Respuesta corta: ninguna de las dos. La respuesta larga implica 74 consultas de benchmark, cuatro estrategias de cuantización, un escritorio recalentado y un modelo de 120 mil millones de parámetros derrotado por algo con menos de una cuarta parte de su tamaño.


El dilema de los LLM locales: parámetros frente a contexto frente a velocidad

Ya sabes por qué quieres ejecutar un LLM local en lugar de alquilar uno. Sin facturación por token en trabajos de marketing con IA que implican un centenar de borradores. Sin que el brief confidencial de un cliente haga un recorrido turístico por el centro de datos de otra empresa. Y reintentos ilimitados a las 9 de la noche cuando el gestor de cuenta decide que la campaña debe ser "más aspiracional".

Así que ahorraste, montaste la máquina, y entonces te topaste con la pregunta que se come un fin de semana entero leyendo foros. La mayoría la formula así: ¿modelo más grande o mejor cuantización? — que es el enfoque equivocado, porque trata la VRAM como si solo comprara una cosa.

Aquí está la verdadera pregunta:

¿Gastas tu VRAM en parámetros, o en todo lo demás?

Los parámetros no son gratis. Los pagas con las dos propiedades que realmente notas cada día de trabajo:

  • Ventana de contexto. El modelo 120B de esta prueba funciona con 16K de contexto. El 35B alcanza 131K — ocho veces más margen, en la misma GPU. Uno de ellos puede contener tu manual de marca, el dossier de investigación y el balance del último trimestre. El otro apenas puede contener el manual de marca.
  • Velocidad. El 120B produce 15–20 tokens por segundo. El 35B hace 95–105. Esa es la diferencia entre pedir veinte variantes de titular y obtenerlas, frente a pedir veinte y aprovechar para hacerte un café.

Así que el dilema no es calidad de cuantización contra tamaño del modelo. Es esto: más parámetros te compran un modelo más profundo que piensa lentamente en una ventana más pequeña. Menos parámetros te compran un modelo más superficial con espacio para leerlo todo, rápido. Cuál gana depende por completo de si tu trabajo está limitado por el razonamiento o por el contexto y la iteración.

Esa es la pregunta para la que se construyó este benchmark.

El equipo: Core i5-13500, 64 GB de RAM, una RTX 5070 Ti junto a una RTX 4060. Dieciséis y ocho gigas de VRAM, un generoso conjunto de memoria del sistema, y una CPU cuyo trabajo principal en todo esto es pasar las palomitas.

Cuatro candidatos, cuatro apuestas completamente distintas sobre cómo gastar esos recursos.


Los contendientes: cuatro estrategias de cuantización para LLM locales

#Modelo (cuant)ContextoVelocidadVisión
1qwen3.6-35b-a3b-i1 (Q4_K_S)131.07295–105 tpsNo
2qwen3.6-27b-mtp (Q4_K_M)60.00028–40 tps
3gemma-4-31b-it-qat (Q4_K_XL)16.38425–35 tps
4gpt-oss-120b (Q8_0)16.38415–20 tpsNo

Capturas de configuración de LM Studio (haz clic en una miniatura para verla a tamaño completo):

Los cuatro son builds GGUF servidos a través de LM Studio. Unas palabras sobre cada uno, porque la historia del hardware es la mitad de la diversión.

gpt-oss-120b en Q8_0 no tiene nada que hacer en esta máquina. Ciento veinte mil millones de parámetros a precisión de ocho bits son aproximadamente 120 GB de pesos, y en la casa hay 24 GB de VRAM. Funciona de todos modos, porque es un modelo de mezcla de expertos: la mayoría de esas capas de expertos dormitan en la RAM del sistema, y solo las activas se llaman a la 5070 Ti. El precio del truco son 15–20 tokens por segundo. Piensa en él como un perezoso muy leído.

qwen3.6-35b-a3b-i1 en Q4_K_S hace el truco contrario. Treinta y cinco mil millones de parámetros en total, pero solo unos 3B activos por token, que es cómo alcanza 95–105 tokens por segundo — llamémoslo siete veces el ritmo del gigante. También lleva una ventana de contexto de 131K, suficiente para tragarse un manual de marca entero sin masticar. La pega: solo trabaja con texto.

qwen3.6-27b-mtp en Q4_K_M es el aburrido sobre el papel. Veintisiete mil millones, denso, una cuantización estándar de gama media. También resulta que ve imágenes, mantiene una ventana de contexto de 60K, y funciona a un ritmo perfectamente llevadero de 28–40 tps.

gemma-4-31b-it-qat en Q4_K_XL fue entrenado con conciencia de cuantización, lo que significa que nació comprimido en lugar de comprimirse después — en teoría, el modelo pequeño más limpio del grupo. Ve imágenes, funciona a 25–35 tps, y está atrapado con una ventana de contexto de 16K.


El benchmark: WritingBench para textos de marketing con IA

Una entrada de blog y una comprobación de sensaciones no son un benchmark. Se trataba de WritingBench, filtrado al subconjunto de Publicidad y Marketing solo en inglés: 74 consultas reales repartidas en 11 tipos de tareas de redacción que la gente de marketing produce genuinamente cada semana.

Historia de marca. Guía de viaje. Contenido para redes sociales. Guion multimedia. Blog personal. Locución promocional. Comentario de marketing. Descripción de producto. Carta de ventas. Copy promocional. Eslóganes.

Si estás evaluando un LLM local para trabajo de marketing con IA, esto es un indicador mucho mejor que un promedio de clasificación general, porque puntúa las tareas específicas en lugar de la capacidad general. Cada respuesta se puntúa sobre 10 según criterios propios de cada consulta — relevancia, creatividad, persuasión, tono — más subconjuntos separados de cumplimiento de estilo, formato y longitud. Ese último punto importa más de lo que parece, porque mide no solo si el texto es bueno, sino si el modelo hizo lo que se le pidió. El juez no sabe quién escribió qué. Sin lealtad de marca, sin beneficio de la duda.


Resultados: el LLM local más pequeño gana

PuestoModeloGlobal
1qwen3.6-27b-mtp (Q4_K_M)7,31
2qwen3.6-35b-a3b-i1 (Q4_K_S)7,13
3gpt-oss-120b (Q8_0)7,07
4gemma-4-31b-it-qat (Q4_K_XL)6,75

El 120B en Q8_0 — el mayor número de parámetros y la mayor precisión del grupo, la configuración que todo hilo de Reddit "solo compra más VRAM" recomienda implícitamente — llegó tercero.

Ganó el modelo más pequeño del grupo.

Si más parámetros y mayor precisión fueran la respuesta, esa tabla estaría al revés. No lo está, así que algo más está haciendo el trabajo.


Por qué ganó el 27B: visión, ventana de contexto, seguimiento de instrucciones

Puede ver. La publicidad funciona con imágenes: fotos de producto, activos de marca, moodboards, lo que el competidor acabe de publicar. El 27b-mtp las mira. El a3b y el 120B trabajan a ciegas a partir de descripciones de texto, lo cual en este sector es como dirigir arte por teléfono.

Puede retener el brief. Los inputs de campaña son largos: directrices de marca, dossieres de investigación, el balance del último trimestre. El ganador tiene una ventana de contexto de 60K. Los dos modelos a los que vence están topados en 16K, y ese tope es exactamente lo que les cuestan esos parámetros extra. (El 131K del a3b es el mayor de todos, lo que convierte su segundo puesto en una historia aparte. Más sobre eso enseguida.)

Sigue instrucciones. Este es el punto menos glamuroso, y es el que decide más trabajo real que cualquiera de los anteriores. Los briefs de marketing están llenos de "que coincida con el tono de marca" y "dos o tres frases, máximo".

Métrica27b-mtp35b-a3b120bgemma-4
Cumplimiento de formato7,847,687,847,24
Cumplimiento de longitud7,166,326,726,08

El 120B empata con el ganador en formato. Nadie se le acerca en longitud. Y el demonio de la velocidad, con todo y sus 131K de contexto, es el peor infractor del grupo con 6,32 — en la práctica, el modelo que responde "dame 300 palabras" con 900 palabras y aire de haberte hecho un favor.


Tarea por tarea: ningún LLM local arrasa

Al hacer zoom en las tareas individuales, la imagen deja de ser una clasificación general y pasa a ser una plantilla de equipo.

TareaGanadorPuntuaciónSegundo puesto
Blog personal27b-mtp7,83120b · 7,20
Contenido para redes sociales27b-mtp7,80120b · 7,57
Guía de viaje27b-mtp7,73120b · 7,67
Guion multimedia27b-mtp7,7035b-a3b · 7,67
Historia de marca27b-mtp7,68120b · 7,64
Locución promocional27b-mtp7,3535b-a3b · 7,32
Eslóganes27b-mtp6,8335b-a3b · 6,63
Comentario de marketing120b7,4727b-mtp · 7,33
Descripción de producto120b7,0935b-a3b · 6,93
Carta de ventas35b-a3b7,1527b-mtp · 6,95
Copy promocional35b-a3b7,0427b-mtp · 7,00

Siete de once son para el 27B. El gigante se lleva dos — y cuáles dos es la parte interesante. Comentario de marketing y descripción de producto: el trabajo analítico, el de explicar qué es esto y por qué importa. Ahí es exactamente donde el conocimiento y la estructura de un modelo grande rentabilizan su inversión.

Ahora mira dónde cae con más fuerza. Eslóganes, 6,48. Copy promocional, 6,44. Último o casi en ambos. El 120B es un analista magnífico que no puede escribir un jingle ni para salvar la vida, y ninguna cantidad de precisión Q8_0 arregla eso, porque la precisión nunca fue el ingrediente que faltaba.

El a3b se lleva las dos tareas cortas de persuasión, carta de ventas y copy promocional — aunque gana esta última por solo 0,04 sobre el 27B, que es un error de redondeo con medalla. Aun así, un modelo que corre a 100 tokens por segundo es un modelo al que puedes pedirle veinte variantes y realmente obtener veinte variantes antes de perder el interés. Ese es el lado rápido-pero-superficial del dilema pagando dividendos exactamente donde cabría esperar: trabajo de volumen, donde la victoria viene de probar más cosas en lugar de pensar más a fondo sobre una sola. Su único pecado real sigue siendo ignorar el conteo de palabras.

¿Y gemma-4? No ganó nada. Último en la puntuación global, último en cumplimiento de formato, último en cumplimiento de longitud, último en relevancia de estilo con 6,70. El entrenamiento consciente de cuantización es una idea genuinamente buena, y aun así este modelo en particular terminó cuarto en un grupo de cuatro. Su única actuación respetable es la consistencia de estilo con 7,25, donde supera por poco al 120B. Ese es todo el resumen de sus mejores momentos.


El veredicto: cómo elegir un LLM local para trabajo de marketing

Deja de preguntarte más grande o más preciso. Empieza a preguntarte cómo es realmente tu semana de trabajo — y en qué lado del dilema parámetros-contra-contexto-y-velocidad cae.

Si sobre todo…UsaPorque
Trabajas con elementos visuales — fotos de producto, activos de marca, referenciasqwen3.6-27b-mtp (Q4_K_M)El único de los mejor puntuados con ojos, mejor cumplimiento del grupo, gana 7 de 11 tareas
Haces lluvia de ideas e iteras rápido sobre documentos de campaña largosqwen3.6-35b-a3b-i1 (Q4_K_S)95–105 tps y 131K de contexto; las mejores cartas de ventas y copy promocional; incluye siempre una línea de "respeta el conteo de palabras" en cada prompt
Analizas, describes, comentasgpt-oss-120b (Q8_0)Gana esas dos tareas por goleada — ten paciencia para 15–20 tps
Ya usas gemma y te lo estás pensandogemma-4-31b-it-qat (Q4_K_XL)Consistencia de estilo decente, pero perdió todas las tareas de este subconjunto; los demás son una mejora gratis

La respuesta real es que esto nunca fue una decisión de un solo modelo. Los cuatro archivos GGUF caben en el mismo disco, y LM Studio cambia entre ellos en más o menos el tiempo que se tarda en releer el brief. Usa el 120B para estrategia y análisis, el 27b-mtp para cualquier cosa con una imagen adjunta, y el a3b para la llamada de las 9 de la noche de "necesitamos un eslogan nuevo en cinco minutos".


Conclusión: la calidad de la cuantización no es tu cuello de botella

Q8_0 no venció a Q4_K_M. El 120B no venció al 27B. Una vez que estás en Q4, la brecha de cuantización es ruido de fondo frente a las cosas que realmente deciden si un LLM local es útil para trabajo de marketing:

  1. ¿Puede ver los activos?
  2. ¿Puede retener todo el brief en su ventana de contexto?
  3. ¿Hace lo que dice el brief?
  4. ¿Es lo bastante rápido como para que realmente lo uses?

Tres de esos cuatro puntos se compran no gastando tu VRAM en parámetros. Ese es todo el hallazgo. Más parámetros compraron un analista brillante que no puede escribir un eslogan, en una ventana de 16K, a velocidad de lectura. Más precisión compró exactitud que no pudo superar a un Q4. El camino de mejora no es más — es ajustado.

Y sí, hacer funcionar un modelo 120B relegándolo a la RAM del sistema es un truco de fiesta. También son dos medallas de oro. Solo no le pidas un jingle.


Método y advertencias

  • Benchmark: WritingBench, subconjunto de Publicidad y Marketing solo en inglés — 74 consultas, 11 tipos de tareas de redacción, puntuadas sobre 10 por un juez LLM según criterios propios de cada consulta, más subconjuntos separados de cumplimiento de estilo, formato y longitud.
  • Hardware: Core i5-13500, 64 GB de RAM, RTX 5070 Ti + RTX 4060 (16 + 8 GB de VRAM), servido a través de LM Studio.
  • Configuraciones: qwen3.6-27b-mtp (Q4_K_M, contexto 60K, visión), qwen3.6-35b-a3b-i1 (Q4_K_S, contexto 131K), gemma-4-31b-it-qat (Q4_K_XL, contexto 16K, visión), gpt-oss-120b (Q8_0, contexto 16K, capas MoE descargadas a RAM).
  • Advertencias: Solo en inglés, un único juez, una sola ejecución por consulta. Son cifras orientativas, no dogma — otras GPU, cuantizaciones o estilos de prompting las moverían. Las diferencias en la cabeza también son ajustadas: 0,24 cubre a los tres modelos líderes, y solo 0,06 separa el segundo puesto del tercero. El déficit de 0,32 de gemma respecto al tercero es el único resultado claramente separado. Trata los desgloses a nivel de tarea como la señal real, no la clasificación global.
TenolifeTENOLIFE