Skip to main content
BVDNET
DienstenWerkPrijzen
Over mij
CVCSS-3D-lab3D-galerij
BlogWoordenboek
Contact
Astrolabe
Modellen & Architectuur

Kwantisatie

Het verlagen van de precisie van modelgewichten van 16/32-bit naar 8/4-bit om de omvang te verkleinen en inferentie te versnellen

Ook bekend als: Quantization, Model Quantization, INT8, INT4, GPTQ, GGUF

Modellen & ArchitectuurIntermediateAI Intel Pipeline
Quantization

Kwantisatie is de techniek van het verlagen van de numerieke precisie van de gewichten en activaties van een model — typisch van 16-bit of 32-bit floating point naar 8-bit of 4-bit integers — om de modelomvang te verkleinen, geheugenvereisten te verminderen en inferentiesnelheid te verbeteren. Een 70B-parametermodel opgeslagen in 16-bit precisie vereist ongeveer 140GB GPU-geheugen; gekwantiseerd naar 4-bit past het in ruwweg 35GB, waardoor het draaibaar wordt op consumentenhardware die eerder onvoldoende was. Kwantisatie ruilt kleine hoeveelheden modelkwaliteit voor dramatische verbeteringen in efficiëntie, en moderne kwantisatiemethoden (GPTQ, AWQ, GGUF) bereiken dit met minimaal kwaliteitsverlies — vaak minder dan 2% degradatie op standaardbenchmarks.

Waarom het belangrijk is

Kwantisatie is de primaire technologie die het mogelijk maakt om grote taalmodellen te draaien op betaalbare hardware. Zonder kwantisatie vereist het inzetten van een 70B-model meerdere enterprise-grade GPU's die tienduizenden euro's kosten. Met 4-bit kwantisatie draait hetzelfde model op een enkele GPU die een fractie van die prijs kost. Dit heeft verstrekkende gevolgen: het maakt lokale LLM-inzet mogelijk voor dataprivacy (geen API-aanroepen die de organisatie verlaten), verlaagt inferentiekosten voor gehoste inzet met 2-4×, en maakt het haalbaar voor onderzoekers en kleine bedrijven om met grote modellen te experimenteren. De combinatie van LoRA voor efficiënte training en kwantisatie voor efficiënte inferentie heeft een praktisch pad gecreëerd voor organisaties om aangepaste LLM's te fine-tunen en in te zetten met bescheiden hardwarebudgetten.

Hoe het werkt

Kwantisatie mapt het continue bereik van floating-point gewichtswaarden naar een kleinere set discrete integerwaarden. Bij 4-bit kwantisatie wordt elk gewicht weergegeven door slechts één van 16 mogelijke waarden (vergeleken met 65.536 voor 16-bit). Het kwantisatieproces bepaalt de optimale mapping die het verschil minimaliseert tussen originele en gekwantiseerde outputs. Post-training kwantisatie (PTQ) converteert een getraind model zonder extra training — methoden zoals GPTQ analyseren kalibratiedata om optimale kwantisatieparameters per laag te vinden. Kwantisatie-bewuste training (QAT) incorporeert kwantisatie tijdens het trainingsproces zelf, waardoor het model kan compenseren voor precisieverlies. Mixed precision houdt kritieke lagen (typisch de eerste en laatste lagen) in hogere precisie terwijl het gros van het model wordt gekwantiseerd. Inferentiesnelheid verbetert doordat integeroperaties sneller zijn dan floating-pointoperaties, en kleinere gewichten minder geheugenbandbreedte vereisen — vaak de werkelijke bottleneck bij LLM-inferentie.

Voorbeeld

Een zorgstartup moet een medisch LLM on-premises draaien vanwege regelgevingscompliance — patiëntgegevens mogen hun netwerk niet verlaten. Het beste open-source medische model heeft 70B parameters en vereist 140GB in 16-bit — ver buiten het bereik van hun twee A100 40GB-GPU's. Kwantisering naar 4-bit met GPTQ reduceert de geheugenvoetafdruk naar 35GB, wat comfortabel past op een enkele GPU met ruimte voor de KV-cache. Ze benchmarken het gekwantiseerde model tegen de full-precision versie op hun medische Q&A-testsuite: de nauwkeurigheid daalt van 89,2% naar 87,8% — een reductie van 1,4% die hun medische toetsingscommissie acceptabel acht gezien de enorme kostenbesparingen. Het gekwantiseerde model verwerkt ook tokens 40% sneller dankzij verminderde geheugenbandbreedte-eisen, wat de responstijd voor de klinische beslissingsondersteuningsinterface verbetert. Totale hardwarekosten: twee ordes van grootte minder dan wat full-precision inzet zou vereisen.

Bronnen

  1. Hugging Face — Quantization OverviewWeb
  2. llama.cpp — Efficient LLM Inference in C/C++GitHub
  3. Dettmers et al. — LLM.int8(): 8-bit Matrix MultiplicationarXiv
  4. Wikipedia

Gerelateerde concepten

Activatiefunctie
Activatiefuncties introduceren niet-lineariteit in neurale netwerken, waardoor ze complexe patronen kunnen leren. Veelgebruikt: ReLU, GELU (transformers), sigmoid, softmax.
Gemini Omni
Google's any-to-any multimodaal foundationmodel dat elke output kan genereren vanuit elke input, met physics-grounded videogeneratie als eerste grote capability.
MiniMax-M2
Een 229.9B parameter Mixture-of-Experts model met slechts 9.8B actieve parameters per token, geoptimaliseerd voor agentische taken en vertonend vroege tekenen van self-evolution—autonoom debuggen van eigen training en aanpassen van scaffolding.
Nemotron-Labs Diffusion
NVIDIA's familie van taalmodellen (3B-14B) die autoregressieve en diffusie-generatie samenvoegen in één architectuur, waardoor zowel GPT-stijl sequentiële generatie als 10-50x snellere parallelle diffusiemodus mogelijk is.

AI-advies

Hulp nodig bij het begrijpen of implementeren van dit concept?

Praat met een expert
Vorige

KV-cache

Volgende

Large Language Model (LLM)

// Hulp nodig bij het implementeren van AI?

Hulp nodig bij het implementeren van AI?

Ik help je dit concept toe te passen in je bedrijf.

Neem contact op

Webontwikkeling en AI-automatisering. Goed gedaan.

Start een project
BVDNETBVDNET

BVDNET bouwt websites en AI-automatisering voor het MKB. BVDART maakt algoritmische abstracte kunst. Twee bedrijven, één adres.

Navigatie
  • Diensten
  • Werk
  • Prijzen
  • Over mij
  • CV
  • CSS-3D-lab
  • 3D-galerij
  • Blog
  • Woordenboek
Contact
  • Start een project
  • berend@bvdnet.nl
© 2026 BVDNET
PrivacybeleidCookiebeleidAlgemene Voorwaarden
Terug naar boven↑

Wij gebruiken cookies om uw ervaring te verbeteren. U kunt kiezen welke soorten cookies u wilt toestaan.