AAIP – Hoofdstuk 13
Support Vector Machines (SVM’s)
13.1 Waarom SVM’s zo belangrijk zijn
Support Vector Machines behoren tot de meest elegante en krachtige algoritmen
in de geschiedenis van machine learning.
SVM’s zijn ontworpen om de perfecte scheidingslijn te vinden —
de lijn met de grootste marge.
Ze zijn extreem effectief voor:
- hoge-dimensiedata,
- kleine datasets,
- complexe classificatieproblemen,
- tekstclassificatie,
- bio-informatica,
- beeldherkenning.
13.2 Het basisidee van SVM’s
Een SVM probeert een hypervlak te vinden dat twee klassen zo goed mogelijk scheidt.
13.2.1 De marge
De marge is de afstand tussen het hypervlak en de dichtstbijzijnde punten.
SVM’s maximaliseren de marge → betere generalisatie.
13.2.2 Support Vectors
Dit zijn de punten die het dichtst bij de scheidingslijn liggen.
Ze bepalen de positie van het hypervlak.
13.3 Lineaire SVM’s
Een lineaire SVM zoekt een rechte scheidingslijn (of hypervlak).
13.3.1 Optimalisatieprobleem
De SVM probeert de marge te maximaliseren terwijl fouten worden geminimaliseerd.
13.3.2 Soft Margin
Laat beperkte fouten toe om robuuster te zijn tegen ruis.
13.3.3 De C‑parameter
C bepaalt de balans tussen:
- grote marge,
- weinig fouten.
13.4 Kernel‑truc: SVM’s worden magisch
De kernel‑truc maakt SVM’s extreem krachtig.
Hiermee kunnen ze niet‑lineaire patronen leren zonder de data expliciet te transformeren.
13.4.1 Veelgebruikte kernels
- Linear Kernel — snel, goed voor tekst
- Polynomial Kernel — leert kromme grenzen
- RBF Kernel — de populairste, extreem krachtig
- Sigmoid Kernel — lijkt op neurale netwerken
De RBF‑kernel maakt SVM’s geschikt voor bijna elk complex probleem.
13.5 SVM’s voor regressie (SVR)
Support Vector Regression gebruikt hetzelfde principe als SVM’s,
maar voorspelt continue waarden.
13.5.1 ε‑insensitive loss
Fouten binnen een marge ε worden genegeerd.
13.5.2 Toepassingen
- tijdreeksvoorspelling,
- financiële modellen,
- energieverbruik,
- medische voorspellingen.
13.6 Voordelen & Nadelen van SVM’s
Voordelen
- werkt goed in hoge dimensies,
- zeer krachtig met kernels,
- goed bij kleine datasets,
- robuust tegen overfitting.
Nadelen
- traag bij grote datasets,
- moeilijk te tunen (C, gamma),
- minder geschikt voor miljoenen samples.
13.7 Hyperparameter Tuning voor SVM’s
Belangrijkste parameters
- C — straf voor fouten
- gamma — bepaalt invloed van punten (RBF)
- kernel — bepaalt de vorm van de grens
Beste aanpak
- Grid Search
- Random Search
- Bayesian Optimization
13.8 Toepassingen van SVM’s
- spamdetectie,
- handgeschreven cijfers (MNIST),
- DNA‑classificatie,
- medische diagnose,
- beeldherkenning,
- tekstclassificatie,
- fraudedetectie.
13.9 Reflectie‑opdracht
Beantwoord de volgende vragen schriftelijk:
- Wat is een support vector?
- Waarom is de marge zo belangrijk?
- Leg in je eigen woorden uit wat de kernel‑truc doet.
- Noem een toepassing van SVM’s die jij interessant vindt.