Terug naar blog
    Collecties
    13 min

    Collectiesuggesties waterdicht maken: merkdetectie, chunking en validatie

    Collectiesuggesties waterdicht maken: merkdetectie, chunking en validatie

    Automatisch producten aan de juiste collecties koppelen klinkt eenvoudig, totdat je het op een catalogus met honderden collecties en duizenden producten toepast. Zonder de juiste waarborgen leidt automatische matching tot precies het soort fouten die het vertrouwen in AI-verrijking ondermijnen: een kinderproduct dat in een volwassencollectie belandt, of een product van merk A dat wordt gekoppeld aan een collectie die exclusief bedoeld is voor merk B. In dit artikel lichten we toe hoe pshly.ai collectiesuggesties waterdicht maakt.

    Het probleem met naïeve matching

    Een simpele aanpak zou zijn om trefwoorden uit de producttitel te vergelijken met trefwoorden in de collectienaam en op basis daarvan een match voor te stellen. Dat werkt voor voor de hand liggende gevallen, maar faalt zodra collecties specifieker worden — bijvoorbeeld een collectie die is voorbehouden aan een specifiek merk, een specifieke doelgroep of een specifiek producttype dat oppervlakkig lijkt op andere producten maar functioneel anders is. Zonder aanvullende logica ontstaan dan fout-positieven: suggesties die op het eerste gezicht plausibel lijken, maar bij nadere inspectie niet kloppen.

    Merkdetectie uit collectietitels

    De eerste waarborg is het herkennen van merknamen in de collectietitel zelf. Wanneer een collectie een merknaam bevat — bijvoorbeeld "Pandora armbanden" of "Nike hardloopschoenen" — wordt dit gedetecteerd en als harde voorwaarde meegenomen. Een product wordt alleen aan die collectie gekoppeld als het daadwerkelijk van dat merk is, ongeacht hoe goed de rest van de producttekst inhoudelijk aansluit. Dit voorkomt de meest voorkomende fout bij automatische collectiesuggesties: een visueel of thematisch gelijkend product dat toevallig van een ander merk is, foutief aan een merkspecifieke collectie koppelen.

    Chunking bij grote collectielijsten

    Winkels met meer dan 60 collecties lopen tegen een technische beperking aan: het is niet efficiënt of betrouwbaar om alle collecties in één keer aan een taalmodel voor te leggen voor matching. Naarmate de lijst langer wordt, neemt de kans toe dat relevante collecties over het hoofd worden gezien of dat de kwaliteit van de matching afneemt door de omvang van de context. Om dit te voorkomen, wordt de collectielijst bij grotere catalogi opgedeeld in kleinere, behapbare groepen — chunking genoemd. Elke groep wordt afzonderlijk geanalyseerd tegen het product, waarna de resultaten worden samengevoegd. Dit houdt de matchkwaliteit consistent, ongeacht of een winkel 20 of 200 collecties heeft.

    Minimale score als drempel

    Niet elke gevonden overeenkomst is sterk genoeg om als suggestie te tonen. Voor elke potentiële match tussen product en collectie wordt een relevantiescore berekend op basis van hoe goed producttype, kenmerken en context overeenkomen met de collectie-inhoud. Alleen matches die boven een ingestelde minimale score uitkomen, worden daadwerkelijk als suggestie gepresenteerd. Dit voorkomt dat zwakke, twijfelachtige matches je collectieoverzicht vervuilen met producten die er net niet goed in passen.

    Post-validatie op merk, doelgroep en type

    Na de eerste matchronde volgt een aparte validatiestap waarin elke voorgestelde koppeling nogmaals wordt getoetst op drie specifieke dimensies:

    • Merk: komt het merk van het product overeen met eventuele merkbeperkingen van de collectie.
    • Doelgroep: sluit het product aan bij de doelgroep die de collectie impliceert — bijvoorbeeld kinderkleding versus volwassenenkleding, of heren versus dames.
    • Producttype: is het daadwerkelijke producttype consistent met wat de collectie beschrijft, ook als de tekstuele overlap groot lijkt.

    Deze validatiestap fungeert als een tweede filter, los van de initiële scoreberekening, en vangt gevallen op waarin een match tekstueel sterk lijkt maar inhoudelijk niet klopt. Pas na het doorstaan van deze validatie wordt een suggestie als betrouwbaar genoeg beschouwd om aan je voor te leggen.

    Waarom fout-positieven zo schadelijk zijn

    Eén verkeerd gekoppeld product in een collectie is meer dan een klein foutje. Het ondermijnt de samenhang van de hele collectie in de ogen van een klant, kan verwarring geven over merkidentiteit, en tast het vertrouwen in de rest van de collectie aan. Bij collecties die specifiek bedoeld zijn voor een merkpartner of een exclusieve doelgroep kan een verkeerde koppeling zelfs contractuele of merkgerelateerde gevoeligheden raken. Vandaar dat de combinatie van merkdetectie, scoredrempel en post-validatie bewust conservatief is ingesteld: liever een terechte suggestie missen dan een onterechte suggestie tonen.

    Hoe dit in de praktijk werkt

    Bij een winkel met meerdere merkgebonden collecties naast algemene thematische collecties, zorgde merkdetectie ervoor dat producten van gastmerken nooit per ongeluk in een collectie van een ander merk terechtkwamen, ook niet wanneer productomschrijvingen sterk op elkaar leken. Chunking hield de matchkwaliteit stabiel ondanks een lijst van meer dan 80 collecties, en de post-validatiestap filterde een klein aantal suggesties eruit die op tekstniveau plausibel leken maar qua doelgroep niet aansloten.

    Wat je zelf kunt doen om matches te verbeteren

    • Zorg dat collectietitels en -beschrijvingen consistent en specifiek zijn, zodat merk- en doelgroepdetectie betrouwbaar werkt.
    • Houd merkgebonden collecties visueel en tekstueel duidelijk onderscheiden van algemene collecties.
    • Controleer bij een eerste bulk-run de voorgestelde suggesties steekproefsgewijs voordat je ze op de volledige catalogus toepast.

    Voor meer over hoe collectieomschrijvingen zelf worden gegenereerd en geoptimaliseerd, zie de pagina over collectieomschrijvingen.

    De minimale score als kwaliteitsknop

    Elke collectiesuggestie krijgt een score die aangeeft hoe zeker het model is van de match. Met de instelling voor de minimale score bepaal je waar de grens ligt. Zet je die laag, dan krijg je volledige dekking met meer ruis en dus meer reviewwerk. Zet je die hoog, dan blijven er alleen zekere matches over en mis je randgevallen. In de praktijk werkt een tweetrapsaanpak het beste: draai eerst een run met een hoge drempel en push die vrijwel ongezien door, en draai daarna een tweede run met een lagere drempel waarbij je de resterende twijfelgevallen bewust doorloopt.

    Merk- en doelgroepvalidatie tegen misplaatsingen

    De meeste foutieve indelingen ontstaan doordat een product qua uiterlijk klopt maar qua merk of doelgroep niet in de collectie thuishoort. Daarom wordt na de AI-analyse nog een validatiestap gedraaid op merk en doelgroep: producten van een ander merk dan de collectie voorschrijft, of voor een afwijkende doelgroep, vallen automatisch af. Grote batches worden bovendien in chunks verwerkt, zodat het model per deel voldoende context houdt en er geen producten wegvallen door een te lange lijst in één aanroep.

    Conclusie

    Automatische collectiesuggesties zijn alleen waardevol als je erop kunt vertrouwen dat ze kloppen. Door merkdetectie, chunking bij grote lijsten, een minimale scoredrempel en een aparte post-validatiestap te combineren, is het systeem in pshly.ai bewust ontworpen om fout-positieven te minimaliseren in plaats van simpelweg zoveel mogelijk suggesties te genereren.

    Wil je zien hoe betrouwbaar de collectiesuggesties voor jouw catalogus zijn? Start gratis en bekijk de eerste voorstellen voor je eigen collecties.

    Veelgestelde vragen

    Waarom missen er soms collecties in de suggesties?

    Meestal doordat de minimale score te hoog staat of doordat de collectie zelf geen duidelijke omschrijving heeft. Verlaag de drempel of vul de collectieomschrijving aan, dan herkent het model het thema beter.

    Hoe voorkom ik producten in de verkeerde collectie?

    Door de merk- en doelgroepvalidatie aan te laten staan. Die filtert na de AI-analyse producten weg die visueel passen maar niet bij het merk of de doelgroep van de collectie horen.

    Werkt dit ook bij catalogi van duizenden producten?

    Ja. Grote batches worden in chunks verwerkt zodat het model per deel genoeg context houdt; de job draait server-side met voortgangsbalk en logs.

    Worden bestaande collectie-indelingen overschreven?

    Nee. Suggesties komen eerst in de reviewmodal en worden pas naar Shopify gepusht nadat je ze goedkeurt.