Preparing your experience...

Lượng tử hóa cao hơn hay nhiều tham số hơn? Đánh giá LLM cục bộ cho marketing AI

— 16 phút đọc

Lượng tử hóa cao hơn hay nhiều tham số hơn? Đánh giá LLM cục bộ cho marketing AI

Lượng tử hóa cao hơn hay nhiều tham số hơn? Đánh giá LLM cục bộ cho marketing AI

Câu trả lời ngắn gọn: không phải cả hai. Câu trả lời dài liên quan đến 74 truy vấn benchmark, bốn chiến lược lượng tử hóa, một chiếc bàn làm việc quá nóng, và một mô hình 120 tỷ tham số bị đánh bại bởi thứ gì đó chưa bằng một phần tư kích thước của nó.


Sự đánh đổi của LLM cục bộ: Tham số vs Ngữ cảnh vs Tốc độ

Bạn đã biết vì sao muốn chạy một LLM cục bộ thay vì thuê một cái. Không phải trả tiền theo token cho công việc marketing AI liên quan đến hàng trăm bản nháp. Không có bản brief bảo mật của khách hàng nào phải "du lịch" qua trung tâm dữ liệu của người khác. Và có thể thử lại vô hạn lần lúc 9 giờ tối khi quản lý khách hàng quyết định chiến dịch cần "tham vọng hơn".

Thế là bạn dành dụm, xây dựng cỗ máy, rồi vấp phải câu hỏi ngốn trọn một cuối tuần đọc diễn đàn. Hầu hết mọi người diễn đạt nó là mô hình lớn hơn hay lượng tử hóa tốt hơn? — đây là cách đặt vấn đề sai, vì nó coi VRAM như thể chỉ mua được một thứ duy nhất.

Đây mới là câu hỏi thực sự:

Bạn chi VRAM cho tham số, hay cho mọi thứ khác?

Tham số không hề miễn phí. Bạn trả giá cho chúng bằng hai đặc tính mà bạn thực sự cảm nhận được mỗi ngày làm việc:

  • Cửa sổ ngữ cảnh. Mô hình 120B trong bài test này chạy với 16K ngữ cảnh. Mô hình 35B đạt 131K — gấp tám lần không gian, trên cùng một GPU. Một cái có thể chứa cả cẩm nang thương hiệu, tài liệu nghiên cứu, và báo cáo tổng kết quý trước. Cái còn lại chỉ vừa đủ chứa cẩm nang thương hiệu.
  • Tốc độ. Mô hình 120B tạo ra 15–20 token mỗi giây. Mô hình 35B đạt 95–105. Đó là sự khác biệt giữa việc yêu cầu hai mươi biến thể tiêu đề và nhận được chúng, so với yêu cầu hai mươi biến thể rồi đi pha cà phê chờ.

Vậy nên sự đánh đổi không phải là chất lượng lượng tử hóa đối đầu với kích thước mô hình. Mà là thế này: nhiều tham số hơn mua cho bạn một mô hình sâu sắc hơn, suy nghĩ chậm rãi trong một cửa sổ nhỏ hơn. Ít tham số hơn mua cho bạn một mô hình nông hơn nhưng có đủ không gian để đọc mọi thứ, nhanh chóng. Ai thắng hoàn toàn phụ thuộc vào việc công việc của bạn bị nghẽn cổ chai bởi khả năng suy luận, hay bởi ngữ cảnh và lặp lại.

Đó là câu hỏi mà bài benchmark này được xây dựng để trả lời.

Bộ máy: Core i5-13500, 64 GB RAM, một RTX 5070 Ti bên cạnh một RTX 4060. Mười sáu và tám gigabyte VRAM, một kho bộ nhớ hệ thống dồi dào, và một CPU mà công việc chính trong tất cả chuyện này là chuyền bắp rang.

Bốn ứng viên, bốn canh bạc hoàn toàn khác nhau về cách chi tiêu những tài nguyên đó.


Các ứng viên: Bốn chiến lược lượng tử hóa LLM cục bộ

#Mô hình (lượng tử)Ngữ cảnhTốc độThị giác
1qwen3.6-35b-a3b-i1 (Q4_K_S)131.07295–105 tpsKhông
2qwen3.6-27b-mtp (Q4_K_M)60.00028–40 tps
3gemma-4-31b-it-qat (Q4_K_XL)16.38425–35 tps
4gpt-oss-120b (Q8_0)16.38415–20 tpsKhông

Ảnh chụp màn hình cấu hình LM Studio (nhấp vào ảnh nhỏ để xem kích thước đầy đủ):

Cả bốn đều là bản build GGUF được phục vụ qua LM Studio. Vài lời về từng cái, vì câu chuyện phần cứng chiếm một nửa niềm vui.

gpt-oss-120b ở Q8_0 đáng lẽ không nên chạy trên cỗ máy này. Một trăm hai mươi tỷ tham số ở độ chính xác tám bit là khoảng 120 GB trọng số, trong khi nhà chỉ có 24 GB VRAM. Nó vẫn hoạt động, vì đây là mô hình mixture-of-experts: hầu hết các lớp chuyên gia ngủ gật trong RAM hệ thống, chỉ những lớp đang hoạt động mới được gọi lên RTX 5070 Ti. Cái giá của chiêu trò này là 15–20 token mỗi giây. Hãy hình dung nó như một con lười đọc rất nhiều sách.

qwen3.6-35b-a3b-i1 ở Q4_K_S thực hiện chiêu ngược lại. Ba mươi lăm tỷ tham số tổng cộng, nhưng chỉ khoảng 3B hoạt động mỗi token, đó là cách nó đạt 95–105 token mỗi giây — gấp khoảng bảy lần tốc độ của gã khổng lồ kia. Nó còn mang cửa sổ ngữ cảnh 131K, đủ để nuốt trọn cả một cẩm nang thương hiệu mà không cần nhai. Điểm trừ: nó chỉ xử lý văn bản.

qwen3.6-27b-mtp ở Q4_K_M là mô hình nhàm chán nhất trên giấy tờ. Hai mươi bảy tỷ, dày đặc, một lượng tử hóa tiêu chuẩn ở mức trung bình. Nhưng nó lại có khả năng nhìn hình ảnh, giữ cửa sổ ngữ cảnh 60K, và chạy ở tốc độ khá dễ chịu 28–40 tps.

gemma-4-31b-it-qat ở Q4_K_XL được huấn luyện có nhận thức về lượng tử hóa, nghĩa là nó sinh ra đã được nén thay vì bị ép nén sau này — về lý thuyết là mô hình nhỏ "sạch" nhất trong nhóm. Nó nhìn được hình ảnh, chạy ở 25–35 tps, và bị kẹt với cửa sổ ngữ cảnh 16K.


Bài benchmark: WritingBench cho nội dung marketing AI

Một bài blog và một lần kiểm tra cảm tính không phải là benchmark. Đây là WritingBench, được lọc theo tập con Quảng cáo & Marketing chỉ dùng tiếng Anh: 74 truy vấn thực tế trải rộng trên 11 loại tác vụ viết mà dân marketing thực sự tạo ra mỗi tuần.

Câu chuyện thương hiệu. Cẩm nang du lịch. Nội dung mạng xã hội. Kịch bản đa phương tiện. Blog cá nhân. Lời thoại quảng cáo. Bình luận marketing. Mô tả sản phẩm. Thư chào bán. Nội dung quảng cáo. Khẩu hiệu.

Nếu bạn đang đánh giá một LLM cục bộ cho công việc marketing AI, đây là một chỉ số đại diện tốt hơn nhiều so với điểm trung bình trên bảng xếp hạng, vì nó chấm điểm các công việc cụ thể thay vì năng lực chung chung. Mỗi phản hồi được chấm trên thang điểm 10 dựa trên các tiêu chí riêng cho từng truy vấn — mức độ liên quan, sự sáng tạo, sức thuyết phục, giọng điệu — cùng các tập con riêng biệt về mức tuân thủ phong cách, định dạng và độ dài. Phần cuối cùng đó quan trọng hơn vẻ ngoài của nó, vì nó đo lường không chỉ việc văn bản có hay không, mà còn việc mô hình có làm đúng những gì được yêu cầu hay không. Giám khảo không biết ai đã viết cái gì. Không có sự thiên vị thương hiệu, không có sự nương tay.


Kết quả: LLM cục bộ nhỏ nhất đã thắng

HạngMô hìnhTổng điểm
1qwen3.6-27b-mtp (Q4_K_M)7,31
2qwen3.6-35b-a3b-i1 (Q4_K_S)7,13
3gpt-oss-120b (Q8_0)7,07
4gemma-4-31b-it-qat (Q4_K_XL)6,75

Mô hình 120B ở Q8_0 — nhiều tham số nhất độ chính xác cao nhất trong danh sách, cấu hình mà bất kỳ chủ đề "cứ mua thêm VRAM" nào trên Reddit cũng ngầm khuyến nghị — lại về đích ở vị trí thứ ba.

Mô hình nhỏ nhất trong nhóm đã chiến thắng.

Nếu nhiều tham số hơn và độ chính xác cao hơn là câu trả lời, thì bảng xếp hạng đó phải bị đảo ngược. Nhưng không, vậy nên có điều gì khác đang thực sự tạo ra hiệu quả.


Vì sao 27B chiến thắng: Thị giác, cửa sổ ngữ cảnh, khả năng làm theo hướng dẫn

Nó nhìn được. Quảng cáo vận hành dựa trên hình ảnh: ảnh sản phẩm, tài sản thương hiệu, bảng cảm hứng (moodboard), bất cứ thứ gì đối thủ vừa đăng. 27b-mtp nhìn thấy chúng. a3b và 120B phải làm việc "mù" dựa trên mô tả văn bản, điều mà trong ngành này chẳng khác nào chỉ đạo hình ảnh qua điện thoại.

Nó nhớ được cả bản brief. Dữ liệu đầu vào của chiến dịch thường dài — hướng dẫn thương hiệu, tài liệu nghiên cứu, báo cáo tổng kết quý trước. Mô hình chiến thắng có cửa sổ ngữ cảnh 60K. Hai mô hình bị nó đánh bại đều bị giới hạn ở 16K, và giới hạn đó chính xác là cái giá phải trả cho những tham số dư thừa kia. (Cửa sổ 131K của a3b là lớn nhất trong tất cả, khiến vị trí thứ hai của nó trở thành một câu chuyện riêng. Sẽ nói thêm ngay sau đây.)

Nó làm theo hướng dẫn. Đây là điểm kém hào nhoáng nhất, nhưng lại quyết định nhiều công việc thực tế hơn bất cứ điều gì kể trên. Các bản brief marketing đầy rẫy yêu cầu "khớp với bảng tông giọng" và "hai đến ba câu, tối đa".

Chỉ số27b-mtp35b-a3b120bgemma-4
Tuân thủ định dạng7,847,687,847,24
Tuân thủ độ dài7,166,326,726,08

120B ngang bằng với mô hình chiến thắng về định dạng. Không ai đến gần nó về độ dài. Còn "con quỷ tốc độ" kia, dù có tận 131K ngữ cảnh, lại là kẻ vi phạm tệ nhất trong nhóm với 6,32 điểm — trên thực tế, đó là mô hình khi bạn yêu cầu "300 từ" thì trả lời bằng 900 từ với vẻ như đã giúp bạn một việc lớn.


Từng tác vụ một: Không có LLM cục bộ nào thắng tất cả

Khi phóng to vào từng tác vụ riêng lẻ, bức tranh không còn là bảng xếp hạng nữa mà trở thành một đội hình với vai trò riêng.

Tác vụNgười chiến thắngĐiểmÁ quân
Blog cá nhân27b-mtp7,83120b · 7,20
Nội dung mạng xã hội27b-mtp7,80120b · 7,57
Cẩm nang du lịch27b-mtp7,73120b · 7,67
Kịch bản đa phương tiện27b-mtp7,7035b-a3b · 7,67
Câu chuyện thương hiệu27b-mtp7,68120b · 7,64
Lời thoại quảng cáo27b-mtp7,3535b-a3b · 7,32
Khẩu hiệu27b-mtp6,8335b-a3b · 6,63
Bình luận marketing120b7,4727b-mtp · 7,33
Mô tả sản phẩm120b7,0935b-a3b · 6,93
Thư chào bán35b-a3b7,1527b-mtp · 6,95
Nội dung quảng cáo35b-a3b7,0427b-mtp · 7,00

Bảy trên mười một tác vụ thuộc về 27B. Gã khổng lồ giành được hai — và hai tác vụ nào mới là phần thú vị. Bình luận marketing và mô tả sản phẩm: công việc mang tính phân tích, kiểu giải thích-đây-là-gì-và-vì-sao-nó-quan-trọng. Đó chính xác là nơi kiến thức và cấu trúc của một mô hình lớn phát huy giá trị.

Giờ hãy nhìn nơi nó gục ngã nặng nề nhất. Khẩu hiệu, 6,48 điểm. Nội dung quảng cáo, 6,44 điểm. Cả hai đều gần chót bảng hoặc chót bảng. 120B là một nhà phân tích xuất sắc nhưng không thể viết nổi một câu khẩu hiệu (jingle) dù có phải đánh đổi cả mạng sống, và không có mức độ chính xác Q8_0 nào khắc phục được điều đó, bởi vì độ chính xác chưa bao giờ là thành phần còn thiếu.

a3b giành hai tác vụ thuyết phục ngắn gọn, thư chào bán và nội dung quảng cáo — dù nó chỉ thắng tác vụ sau với cách biệt 0,04 điểm so với 27B, chẳng khác nào một sai số làm tròn được đeo huy chương. Dù vậy, một mô hình chạy ở tốc độ 100 token mỗi giây là một mô hình mà bạn có thể yêu cầu hai mươi biến thể và thực sự nhận được hai mươi biến thể trước khi mất hứng thú. Đó là mặt nhanh-nhưng-nông của sự đánh đổi phát huy tác dụng đúng nơi người ta mong đợi: công việc theo số lượng lớn, nơi chiến thắng đến từ việc thử nhiều thứ hơn thay vì suy nghĩ sâu hơn về một thứ. Tội lỗi thực sự duy nhất của nó vẫn là phớt lờ số lượng từ yêu cầu.

Còn gemma-4? Nó chẳng thắng gì cả. Chót bảng về điểm tổng, chót bảng về tuân thủ định dạng, chót bảng về tuân thủ độ dài, chót bảng về mức độ liên quan phong cách với 6,70 điểm. Huấn luyện có nhận thức về lượng tử hóa thực sự là một ý tưởng hay, vậy mà mô hình cụ thể này vẫn về chót trong nhóm bốn mô hình. Màn trình diễn đáng nể duy nhất của nó là độ nhất quán phong cách với 7,25 điểm, nơi nó nhỉnh hơn 120B một chút. Đó là toàn bộ những khoảnh khắc nổi bật của nó.


Kết luận: Cách chọn LLM cục bộ cho công việc marketing

Đừng hỏi lớn hơn hay chính xác hơn nữa. Hãy hỏi công việc thực tế hàng tuần của bạn trông như thế nào — và nó rơi vào bên nào trong sự đánh đổi giữa tham số với ngữ cảnh-và-tốc độ.

Nếu bạn chủ yếu…Hãy dùng
Làm việc với hình ảnh — ảnh sản phẩm, tài sản thương hiệu, tài liệu tham khảoqwen3.6-27b-mtp (Q4_K_M)Mô hình điểm cao duy nhất có "mắt", mức tuân thủ tốt nhất trong nhóm, thắng 7 trên 11 tác vụ
Động não và lặp lại nhanh trên các tài liệu chiến dịch dàiqwen3.6-35b-a3b-i1 (Q4_K_S)95–105 tps và 131K ngữ cảnh; thư chào bán và nội dung quảng cáo tốt nhất; nhớ dành một dòng "bám sát số lượng từ" trong mỗi prompt
Phân tích, mô tả, bình luậngpt-oss-120b (Q8_0)Nó thắng hai tác vụ này rõ ràng — hãy chuẩn bị kiên nhẫn cho 15–20 tps
Đang dùng gemma và đang phân vângemma-4-31b-it-qat (Q4_K_XL)Độ nhất quán phong cách khá ổn, nhưng nó thua mọi tác vụ trong tập con này; các mô hình khác là một bản nâng cấp miễn phí

Câu trả lời thực sự là chuyện này chưa bao giờ là quyết định chọn một mô hình duy nhất. Cả bốn tệp GGUF đều vừa trên cùng một ổ đĩa, và LM Studio chuyển đổi giữa chúng trong khoảng thời gian tương đương với việc đọc lại bản brief. Hãy dùng 120B cho chiến lược và phân tích, 27b-mtp cho bất cứ thứ gì kèm hình ảnh, và a3b cho cuộc gọi lúc 9 giờ tối kiểu "chúng ta cần một khẩu hiệu mới trong năm phút".


Kết luận cuối cùng: Chất lượng lượng tử hóa không phải nút thắt cổ chai của bạn

Q8_0 không đánh bại Q4_K_M. 120B không đánh bại 27B. Một khi đã ở mức Q4, khoảng cách lượng tử hóa chỉ là nhiễu nền so với những thứ thực sự quyết định một LLM cục bộ có hữu ích cho công việc marketing hay không:

  1. Nó có nhìn được các tài sản hình ảnh không?
  2. Nó có giữ được toàn bộ bản brief trong cửa sổ ngữ cảnh không?
  3. Nó có làm đúng những gì bản brief yêu cầu không?
  4. Nó có đủ nhanh để bạn thực sự sử dụng không?

Ba trong bốn điều đó có được nhờ việc không chi VRAM cho tham số. Đó là toàn bộ phát hiện. Nhiều tham số hơn mua được một nhà phân tích xuất sắc nhưng không thể viết nổi một khẩu hiệu, trong một cửa sổ 16K, với tốc độ đọc chậm. Độ chính xác cao hơn mua được sự chuẩn xác nhưng không thể vượt qua một mô hình Q4. Con đường nâng cấp không phải là nhiều hơn — mà là phù hợp hơn.

Và đúng vậy, việc chạy một mô hình 120B bằng cách nhét nó vào RAM hệ thống là một chiêu trò mua vui. Nhưng nó cũng mang về hai huy chương vàng. Chỉ đừng nhờ nó viết khẩu hiệu quảng cáo.


Phương pháp & Lưu ý

  • Benchmark: WritingBench, tập con Quảng cáo & Marketing chỉ dùng tiếng Anh — 74 truy vấn, 11 loại tác vụ viết, được chấm trên thang điểm 10 bởi một giám khảo LLM dựa trên tiêu chí riêng cho từng truy vấn, cùng các tập con riêng biệt về tuân thủ phong cách, định dạng và độ dài.
  • Phần cứng: Core i5-13500, 64 GB RAM, RTX 5070 Ti + RTX 4060 (16 + 8 GB VRAM), được phục vụ qua LM Studio.
  • Cấu hình: qwen3.6-27b-mtp (Q4_K_M, ngữ cảnh 60K, thị giác), qwen3.6-35b-a3b-i1 (Q4_K_S, ngữ cảnh 131K), gemma-4-31b-it-qat (Q4_K_XL, ngữ cảnh 16K, thị giác), gpt-oss-120b (Q8_0, ngữ cảnh 16K, các lớp MoE được đẩy sang RAM).
  • Lưu ý: Chỉ dùng tiếng Anh, một giám khảo duy nhất, một lượt chạy mẫu cho mỗi truy vấn. Đây là những con số mang tính định hướng, không phải chân lý tuyệt đối — GPU, mức lượng tử hóa, hoặc phong cách prompt khác nhau sẽ làm thay đổi chúng. Khoảng cách ở nhóm dẫn đầu cũng khá sít sao: 0,24 điểm bao trùm cả ba mô hình dẫn đầu, và chỉ 0,06 điểm ngăn cách vị trí thứ hai với thứ ba. Khoảng cách 0,32 điểm của gemma so với vị trí thứ ba là kết quả duy nhất tách biệt rõ rệt. Hãy coi các số liệu phân tách theo từng tác vụ là tín hiệu thực sự, chứ không phải bảng xếp hạng tổng thể.
TenolifeTENOLIFE