Zo testen we AI companions

Elke aanbieder krijgt dezelfde gesprekken, op dezelfde manier. Hieronder staat precies welke. Zo kun je zelf nagaan waar een conclusie op rust, en waar niet.

Waarom een vast protocol

Een AI vriendin die in het eerste gesprek indruk maakt, kan je na een week glashard vergeten. En een app die op de homepage "vloeiend Nederlands" belooft, kan bij het eerste spreekwoord de mist in gaan. Losse indrukken zeggen dus weinig.

Daarom voeren we bij elke aanbieder dezelfde gesprekken, met dezelfde fictieve testpersoon en op vaste momenten. We schrijven op wat er gebeurde, ook als het tegenvalt. Pas als alle onderdelen klaar zijn, verschijnt een review.

Dit is versie 1 van het protocol (oktober 2026). Passen we het aan, dan zetten we bij elke review welke versie is gebruikt.

Voorbereiding

  • We maken een account aan zoals een gewone gebruiker dat doet, met een fictieve volwassen testpersoon. Echte persoonsgegevens gebruiken we niet.
  • We noteren apparaat, app- of webversie, taalinstelling, gekozen personage en welk abonnement we gebruiken.
  • Abonnementen betalen we zelf. Krijgen we ooit toegang van een aanbieder, dan staat dat bij de review.
  • Alle gesprekken en schermafbeeldingen bewaren we. In een review laten we korte fragmenten zien, zonder accountgegevens.

Nederlands: tien proeven

Elke proef doen we twee keer, in een nieuw gesprek. We laten alle uitkomsten meetellen, niet alleen de beste.

  1. Kennismaken. "Ik heet Noor en ik wil even in het Nederlands praten. Vraag me één ding over mijn dag." Blijft de AI in het Nederlands, en stelt hij echt één vraag?
  2. Spreektaal. "Het liep vandaag nogal in de soep op werk." Snapt de AI dat het om een mislukte dag gaat, of begint hij over soep?
  3. Verbeteren. We noemen een beroep en corrigeren dat een paar berichten later. Gebruikt de AI daarna het juiste beroep?
  4. Terugverwijzen. We noemen twee afspraken en vragen later naar "die van vrijdag". Weet de AI welke we bedoelen?
  5. Opdracht volgen. "Antwoord in twee korte zinnen, zonder emoji." Lukt dat?
  6. Ironie. Een droge opmerking met context. Reageert de AI passend, of neemt hij alles letterlijk? Dit onderdeel is deels smaak; dat zeggen we er ook bij.
  7. Dubbelzinnig. Een vage verwijzing. Vraagt de AI door, of verzint hij er zelf iets bij?
  8. Van onderwerp wisselen. Van hobby naar weekendplanning en terug. Blijven de feiten kloppen?
  9. Een grens aangeven. "Ik wil vandaag niet flirten, laten we het over muziek hebben." Respecteert de AI dat?
  10. Lang gesprek. Twintig berichten met drie feiten erin verstopt. Daarna vragen we naar die feiten.

Per proef kijken we naar vier dingen: deed de AI wat we vroegen, was het Nederlands natuurlijk, gebruikte hij de context goed, en verzon hij dingen die we nooit gezegd hadden.

Geheugen: drie proeven, met echte wachttijd

Een naam onthouden in het volgende bericht is makkelijk. Het gaat erom wat er morgen en volgende week nog over is.

ProefWat we doenWanneer we het vragen
A. Binnen één gesprekDrie fictieve voorkeuren noemenNa twintig tussenliggende berichten
B. Over gesprekken heenDezelfde voorkeuren, zonder ze te herhalenNa 24 uur en na 7 dagen, in een nieuw gesprek
C. Corrigeren en vergetenEén voorkeur aanpassen, en de vergeetfunctie proberen als die er isEen dag later

Per feit noteren we: goed, half goed, vergeten of verkeerd ingevuld. Die zeven dagen wachten we echt af. Een week-test valt niet op één middag te doen.

Een wisknop in de app laat zien wat je als gebruiker kunt doen. Of de gegevens daarna ook bij de aanbieder weg zijn, kunnen we van buitenaf niet controleren. Dat schrijven we er dan ook bij.

Foto's, spraak en video

Alleen als de functie in het geteste abonnement zit. Voor beelden gebruiken we vijf nette opdrachten, zoals "hetzelfde personage op een station in de regen". We kijken of de opdracht wordt gevolgd, of het personage herkenbaar blijft, hoe lang het duurt en wat het kost.

Bij spraak en video maken we onderscheid tussen een vooraf opgenomen fragment, iets wat de AI voor je genereert en een live gesprek. Dat zijn drie heel verschillende dingen, die aanbieders graag op één hoop gooien.

Prijs: tot aan de kassa

We kijken op de prijspagina en lopen daarna het afrekenproces door tot vlak voor betalen. We noteren valuta, of de btw erbij zit, maand- of jaarprijs, automatische verlenging, wat er inbegrepen is en waarvoor je extra betaalt (credits, tokens, losse foto's). Rekenen we een dollarprijs om naar euro's, dan staan de koers en de datum erbij.

Zo lees je onze resultaten

Bij elke bevinding staat een van deze labels:

LabelBetekenis
Zelf gezienWe hebben het in onze eigen test zien gebeuren.
Volgens de aanbiederHet staat in de documentatie of op de website, maar we hebben het niet zelf gecontroleerd.
Niet getestWe hebben er niet naar gekeken. Dat zegt niets over of het werkt.
Niet in dit abonnementDe functie bestaat misschien, maar zat niet in het pakket dat we testten.

We geven geen sterren en geen eindcijfer. Eén getal doet geen recht aan een app die goed Nederlands spreekt maar alles vergeet. Waar we tellen, staat de noemer erbij: "7 van de 20 keer", niet "70 procent".

Wanneer we opnieuw testen

Apps veranderen snel. Prijzen controleren we elke maand. Een review kijken we minstens elk kwartaal na, en eerder als een aanbieder iets groots aanpast. Bij elke review staat wanneer we hebben getest. Oude resultaten blijven met hun datum zichtbaar, zodat je kunt zien wat er veranderd is.

Zie je iets wat niet meer klopt? Laat het ons weten.