
Een A/B-test is een gecontroleerd experiment waarbij bezoekers willekeurig één van twee varianten zien, zodat je causaal kunt meten welke versie beter scoort op een vooraf gekozen KPI. Zonder die willekeur en zonder een vaste succesmaatstaf is het geen experiment, maar een mening in een meetjasje.
Veel mensen raden aan om gewoon twee versies naast elkaar te zetten en de winnaar te kiezen. Dat klinkt praktisch, maar in de Nederlandse praktijk mis je dan al snel de basis, zoals randomisatie, een duidelijke meetperiode en genoeg verkeer om toeval uit te sluiten. Juist daar gaat het vaak mis, zeker bij horeca, lokale dienstverleners en Brainport-bedrijven die hun website serieus willen verbeteren.
Wat is A/B-testen eigenlijk
A/B-testen betekent dat je één bestaande versie, variant A, vergelijkt met een gewijzigde versie, variant B. De bezoekers worden willekeurig verdeeld, zodat je verschillen in klikgedrag, formulierinzendingen of reserveringen kunt koppelen aan die ene wijziging, en niet aan toeval of een andere bezoekersgroep. De Nederlandse zorgcontext laat zien waarom dat onderscheid telt, de NZa benadrukt dat een gerandomiseerde gecontroleerde trial normaal sterk is voor causale metingen, maar niet altijd past in de praktijk, waardoor je andere analysemethoden nodig hebt en vooraf scherp moet definiëren wat je wilt meten. NZa onderzoekskader voor experimenten met alternatieve bekostiging

Waarom willekeur en één KPI het verschil maken
Zonder willekeurige toewijzing vergelijk je vaak appelen met peren. Misschien krijgt variant B vooral mobiel verkeer, of wordt die alleen op rustige dagen getoond. Dan zie je een verschil, maar je weet niet of de wijziging het veroorzaakte.
De tweede bouwsteen is één vooraf gekozen primaire KPI. Bij een restaurant kan dat een reservering zijn, bij een B2B-site een formulierverzending, bij een webshop een aankoop. Als je achteraf meerdere doelen naast elkaar legt, maak je het jezelf te makkelijk om een toevallig voordeel als succes te lezen.
Praktische regel: verander liefst één dominante variabele tegelijk. Een andere CTA-tekst én een nieuwe afbeelding én een andere headline maken het lastig om te zien wat echt werkte.
Een herkenbaar horecavoorbeeld
Stel dat een restaurant op de reserveringspagina twee versies test. Variant A zegt simpelweg “Reserveer”, variant B zegt “Reserveer je tafel”. Dat lijkt een klein verschil, maar alleen vooraf vastgelegde metingen maken duidelijk of die concretere formulering ook echt minder frictie geeft.
Daar hoort een goede landingspagina bij, met een duidelijke route naar actie. Wie daar verder op wil inzoomen, kan ook kijken naar wat een landingspagina is. Zonder heldere paginadoelstelling wordt A/B-testen al snel een losse stylingoefening in plaats van een zakelijke keuze.
Hoe een betrouwbare test werkt
Een betrouwbare test begint bij de opzet. Eerst bepaal je wie de test ziet, daarna welke wijziging je onderzoekt, vervolgens hoeveel bezoekers je nodig hebt, en pas daarna leg je vast wanneer je de uitkomst beoordeelt. De Nederlandse uitleg over A/B-testen benadrukt precies dat punt. Een test werkt alleen goed als toewijzing, meetperiode, doelgroep en primaire succesmaat vooraf zijn bepaald. AP over A/B-testen en de AVG Een degelijke uitvoering van die vier voorwaarden vraagt om een goede technische basis, zoals uitgelegd in onze pagina over website en marketing.

Vier voorwaarden die je niet kunt overslaan
Randomisatie zorgt ervoor dat beide varianten vergelijkbare bezoekers krijgen. Één dominante variabele houdt de test leesbaar. Steekproefgrootte voorkomt dat je beslist op te weinig data. En een vast evaluatiemoment voorkomt dat je te vroeg juicht zodra variant B even voorligt.
Een kleine toename lijkt snel overtuigend, maar zegt op zichzelf weinig. Een stijging van 4,0% naar 4,8% is een absolute toename van 0,8 procentpunt en een relatieve stijging van 20%, maar dat bewijst niet automatisch dat B beter is, omdat onzekerheid en steekproefomvang meetellen. Data.overheid.nl als voorbeeld van gestructureerde publieke databronnen
Waarom vroeg stoppen je test verpest
Veel teams stoppen zodra variant B tijdelijk boven A staat. Dat voelt efficiënt, maar het vergroot de kans op een vals-positieve conclusie. Dan meet je vooral ruis, geen hard bewijs.
Een Brainport-start-up die twee landingspagina's test, kan hier snel in trappen. De ene week presteert een variant beter door een campagnepiek, de volgende week trekt een andere verkeersbron de cijfers scheef. Zonder vaste einddatum trek je te vroeg een conclusie.
Guardrails horen erbij
Een goede test kijkt niet alleen naar de hoofd-KPI. Bij een horecawebsite kan een hogere klikratio weinig waard zijn als de mobiele laadtijd slechter wordt of als reserveringen niet meestijgen. Daarom hoort een test naast de primaire uitkomst ook guardrail-metrics te meten.
Wanneer A/B-testen juist niet werkt
De veelgehoorde stelling is dat elk bedrijf moet testen. In Nederland is de praktijk minder simpel. A/B-testingtools werden in 2025 op slechts 1,6% van Nederlandse websites aangetroffen, wat laat zien dat veel organisaties er nog niet volwassen mee werken of er gewoon te weinig volume voor hebben. Onderzoek naar A/B-testingtools op Nederlandse websites Voor meer context over wanneer testen wel of niet zinvol is, zie onze richtlijn over wanneer AB-testen niet werkt.

Lage volumes vragen om andere keuzes
Bij restaurants, lokale dienstverleners en niche-B2B-bedrijven is het verkeer vaak te beperkt om kleine verschillen hard aan te tonen. Dan wordt een A/B-test al snel traag of onzeker, net als een horecazaak die op basis van drie reserveringen per avond al conclusies wil trekken over een nieuwe menukaart. Je krijgt dan geen helder signaal, maar vooral ruis.
Eerst kijken naar klantinterviews, usability-tests en heatmaps geeft dan meer houvast. Daarmee zie je waar mensen afhaken en welke frictie echt telt, nog vóór je varianten gaat bouwen.
Een kleine organisatie hoeft niet eerst “meer te testen”. Die moet eerst scherper begrijpen wat het probleem eigenlijk is.
Qualitatief onderzoek is dan vaak waardevoller
Bij lage volumes levert kwalitatief onderzoek vaak meer richting op dan eindeloos schuiven met knoppen, headlines of kleuren. Je hoort waarom mensen twijfelen, waar ze afhaken en welke woorden niet landen. Pas daarna heeft een beperkte kwantitatieve test zin.
Dat past ook beter bij merkstrategie. Een restaurant of B2B-dienstverlener kan meer winnen met een scherpere positionering dan met een cosmetische wijziging. Een test helpt dan om grote aannames te toetsen, niet om elk detail afzonderlijk op te lossen.
AVG en privacy-by-design bij experimenten
In Nederland is een A/B-test niet alleen een meetvraag, maar ook een AVG-vraag. De Autoriteit Persoonsgegevens maakt duidelijk dat persoonsgegevens alle informatie zijn die direct of indirect naar een natuurlijke persoon herleidbaar is, dus ook webanalytics, cookie-ID's, CRM-koppelingen en gedragssegmenten kunnen daaronder vallen. Daardoor moet je al bij het ontwerp weten wat je verzamelt, waarom je dat doet en hoe lang je het bewaart. Wat zijn persoonsgegevens volgens de AP

Drie keuzes die direct helpen
Gebruik waar mogelijk geaggregeerde teldata in plaats van individueel gedrag. Voer server-side randomisatie uit zodat je minder client-side tracking nodig hebt. En koppel testgroepen niet aan gevoelige profielkenmerken zoals leeftijd, gezondheid of aankoopgeschiedenis als dat niet nodig is voor het experiment.
Een tijdelijke, pseudonieme experiment-ID is vaak praktischer dan een test die meteen op naam, e-mailadres of volledig klantprofiel draait. Dat is vooral relevant voor een restaurant of een Brainport-start-up die simpel wil testen of een andere CTA beter werkt. Voor transparantie in je privacyverklaring is een helder privacybeleid een nuttig referentiepunt, zoals het overzicht van FormHub privacybeleid.
Wanneer extra toetsing nodig is
Niet elke test is even onschuldig. De Autoriteit Persoonsgegevens maakt onderscheid tussen gewone varianten, zoals kleur of volgorde, en experimenten die gebruikers psychologisch willen beïnvloeden. In dat laatste geval moet je veel kritischer kijken naar proportionaliteit en naar de vraag of een DPIA nodig is.
Ook de Universiteit Twente adviseert als uitgangspunt om geen persoonsgegevens in testomgevingen te gebruiken, en als dat niet lukt, zo weinig mogelijk. In de praktijk betekent dat simpel gezegd: begin klein, maak je datastromen uitlegbaar en houd testdoelen strak afgebakend. Richtlijn over persoonsgegevens in testomgevingen
Een praktische ontwerpregel
Een test die technisch klopt maar bezoekers stiekem profileert, is geen duurzame basis voor conversieoptimalisatie. Privacy-by-design is dus geen juridische afvinklijst achteraf, maar een ontwerpkeuze vanaf het begin.
Steekproefgrootte en testduur in de praktijk
De benodigde steekproef hangt sterk af van het effect dat je wilt aantonen. Kleine verbeteringen vragen veel meer bezoekers dan grote, omdat ruis anders te makkelijk als resultaat verschijnt. Een Nederlands rekenvoorbeeld laat zien dat het aantonen van een omzetverandering van 5% bij 80% power en 5% significantie al 147.456 gebruikers per variant kan vereisen. Rekenvoorbeeld voor steekproefgrootte
| Profiel | Bezoekers per maand | Varianten | Looptijd | Aanbevolen methode |
|---|---|---|---|---|
| Klein restaurant | Laag volume | 2 | Lang, vaak onpraktisch | Eerst interviews, heatmaps en een beperkte test |
| Lokale dienstverlener | Beperkt volume | 2 | Alleen met duidelijke hypothese | Kwalitatief onderzoek met een gerichte A/B-test |
| B2B-site | Gemiddeld tot hoger volume | 2 | Vast testvenster | A/B-test met guardrail-metrics |
| Scale-up in Brainport | Wisselend verkeer | 2 | Vooraf bepaald evaluatiemoment | Test plus segmentanalyse |
| Grote funnel met veel verkeer | Hoog volume | 2 | Strak geplande periode | Volledige A/B-test |
Kies de methode op basis van volume
Een restaurant met beperkte instroom kan beter niet blind vertrouwen op een formele test. Daar zijn interviews met gasten, observatie en een paar scherpe website-aanpassingen vaak nuttiger. Een B2B-site met meer sessies kan wel degelijk een serieuze test draaien, mits de KPI, looptijd en segmenten vooraf vastliggen.
De lastigste fout is niet te weinig experimenteren, maar te veel verwachten van te weinig data. Als je testbudget klein is, moet je prioriteren op impact en haalbaarheid. Dat is precies het verschil tussen een volwassen testprogramma en een reeks losse probes.
Voor de bredere onderzoeksaanpak is een goede mix belangrijk. Marktonderzoeksmethoden helpen om niet alleen op de uitkomst te sturen, maar ook op de vraag of een test überhaupt verstandig is.
A/B-testen in de praktijk bij horeca en B2B
Bij een Eindhovens restaurant kan een reserveringspagina testbaar worden gemaakt zonder de hele site om te gooien. Variant A gebruikt een generieke knop, variant B maakt de reserveringsactie concreter. Als de mobiele laadtijd als guardrail gelijk blijft, zie je beter of de inhoudelijke wijziging ook echt helpt. Voor bredere online zichtbaarheid speelt daarbij soms ook de samenhang met e-commerce marketing mee, zeker als reserveren en bestellen dicht bij elkaar liggen.
Horeca vraagt om frictie verlagen
In de horeca draait veel om gemak. Gasten willen snel zien wat ze moeten doen, zonder omwegen of twijfel. Een sterkere CTA helpt alleen als de rest van de pagina die belofte ondersteunt.
Bij Koll&Burg Design kijken wij dan niet alleen naar de knop, maar naar het hele merkbeeld eromheen. De horeca-ervaring met onder meer ZwartWit Koffie, Fifth NRE, Restaurant Olijf, Manca en Restaurant Crijns laat goed zien dat een test pas waarde heeft als hij past bij de merkbeleving en de dagelijkse operatie.
B2B vraagt om een andere vraag
Een Brainport-dienstverlener test meestal niet een knop, maar een waardepropositie. De vraag is dan of twee doelgroepen hetzelfde verhaal begrijpen en waarderen. In zo'n geval toetst A/B-testen niet de kleur van een knop, maar de scherpte van de positionering.
Sterke les: een test moet passen bij je merkfase. Een start-up valideert vaak de propositie, een horecaformule de reserveringsfrictie, een gevestigde B2B-speler de geloofwaardigheid van de belofte.
Koll&Burg Design kan zo'n experiment onderdeel maken van een breder brandingtraject, van strategische sessie tot implementatie. Het helpt om merkstrategie, design en meetplan niet als losse eilanden te behandelen, maar als één besluitvormingsproces.
Checklist voordat je begint met testen
Een goede test start met zeven vragen. Is de hypothese concreet genoeg om te toetsen. Is er voldoende verkeer voor betrouwbare uitkomsten. Staat de primaire KPI vooraf vast. Is randomisatie technisch geregeld. Is de AVG-check gedaan. Ligt de looptijd al vast. En is duidelijk wat je doet als A of B wint, of als de test niets oplevert.
Als je op meer dan één vraag twijfelt, is een test waarschijnlijk nog te vroeg. Dan loont het om eerst de merkpositie, de content of de meetinrichting aan te scherpen. Pas daarna wordt A/B-testen een nuttig instrument in plaats van een duur omweggetje.
Koll&Burg Design helpt merken in Eindhoven en de Brainport regio om keuzes scherper te maken, van strategie tot visuele uitwerking en implementatie. Als je wilt sparren over A/B-testen binnen een bredere merk- of websiteaanpak, bekijk dan Koll&Burg Design of kom langs op de Prins Hendrikstraat 1 in hartje Eindhoven.


