Slik strukturerer du produktkataloger i CSV og JSON for presis AI-oppslag

Når e-handelsbedrifter og B2B-leverandører skal trene AI-chatboten sin på produktsortimentet, velger mange å laste opp eksisterende CSV- eller JSON-filer rett fra ERP- og PIM-systemet. Uten tilpasning opplever mange likevel at chatboten forveksler dimensjoner, oppgir feil priser eller kobler tilbehør til feil hovedprodukt. Årsaken er at tradisjonelle databasetabeller er bygget for relasjonelle spørringer, ikke for semantiske språksøk. I denne guiden viser vi hvordan du formaterer produktdata i CSV og JSON for å redusere attributthallusinasjoner og gi kunden mer pålitelige svar.
Hvorfor rå katalogeksport fører til attributthallusinasjoner
Tradisjonelle e-handelsdatabaser og PIM-systemer lagrer data i svært komprimerte eller relasjonelle formater. En typisk rå CSV-eksport har ofte kryptiske kolonnenavn (for eksempel "attr_12_val" eller "qty_p3"), mens verdier avhenger av overordnede kategoritre. Når en moderne RAG-basert AI-chatbot prosesserer denne filen, deles dokumentet inn i mindre tekstblokker (såkalte chunks).
Dersom en tekstblokk oppstår midt i en tabell med hundrevis av rader uten synlige kolonneoverskrifter, mister språkmodellen den semantiske sammenhengen. Resultatet er attributthallusinasjoner: chatboten gjetter at en VESA-monteringsstørrelse tilhører en bærbar PC i stedet for skjermen på raden over, eller at en pris uten valutaangivelse gjelder eksklusive mva i stedet for inklusive mva.
For å sikre høyere treffsikkerhet må hver enkelt oppføring i filen være selvstendig og bære sin egen kontekst. Du bør unngå tre vanlige feller i rådata:
- Nøstede objekter uten kontekst:JSON-strukturer der nøkler som "width" ligger tre nivåer ned under en anonym matrise.
- Kryptiske forkortelser:Kolonnenavn som krever intern kunnskap for å forstå, som "dim_w_mm" uten forklaring.
- Manglende produktnavn per rad: CSV-rader som bare oppgir en under-SKU uten å gjenta hovedproduktets navn.
Beste praksis for CSV: kolonnenavn, flating og eksplisitt kontekst
CSV er et utmerket og kostnadseffektivt format for AI-trening fordi det er lett å oppdatere og vedlikeholde. For at AI-chatboten skal forstå tabellen pålitelig, må CSV-filen formateres etter prinsipper om eksplisitt kontekst og flat struktur.
Sørg for at den første raden i CSV-filen bruker fulle, beskrivende kolonnenavn på naturlig språk. I stedet for "Vekt", skriv "Vekt (kg)". I stedet for "Pris", skriv "Pris inkl. mva (NOK)". Videre må hver enkelt rad inneholde produktets fulle navn eller hovedkategori, slik at om raden hentes ut som en enkelt tekstblokk, forstår AI-en umiddelbart hvilket produkt dataene tilhører.
Følg denne sjekklisten for oppbygging av CSV-kataloger:
- Flat ut hierarkier: Unngå å slå sammen celler eller dele opp et produkt over flere rader. Én rad skal tilsvare ett unikt produkt eller én SKU.
- Inkluder fritekstsammendrag:Legg til en dedikert kolonne kalt "Produktbeskrivelse" som oppsummerer nøkkeldata i hele setninger (f.eks. "Dette er en ergometersykkel tilpasset hjemmetrening med tålegrense på 130 kg.").
- Bruk konsistente separatorer: Bruk standard kommaseparering eller semikolon, og sørg for at tekstfelt med komma omsluttes av anførselstegn.
Eksempel på en flat CSV-rad med eksplisitt kontekst:
Product Name,SKU,Weight (kg),Price incl. VAT (NOK),Product Summary "Acme Monitor 27"" Pro",MON-27-PRO,5.2,4490,"27-tommers skjerm med VESA 100x100, vekt 5,2 kg, pris 4490 NOK inkl. mva."
Optimalisering av JSON: struktur, nøkkel-verdi-par og fritekstsammendrag
Dersom produktkatalogen din har mange fleksible spesifikasjoner, variasjoner og kompatibilitetslister, er JSON ofte et mer fleksibelt format enn CSV. Likevel kan en feilstrukturert JSON-fil skape store utfordringer under vektorsøk.
Unngå store ustrukturerte matriser der hundrevis av produkter ligger i én lang liste under én felles nøkkel. Strukturér heller filen som en liste av selvstendige objekter, der hvert objekt har tydelige, semantiske nøkkel-verdi-par. Hvis et produkt har tekniske spesifikasjoner, formater dem som flate nøkler som "skjermstørrelse_tommer": 27 i stedet for dype, anonyme arrays som "specs": [{"id": 1, "v": "27"}].
Et svært effektivt grep er å inkludere et syntetisert fritekstfelt inne i hvert JSON-objekt (for eksempel "ai_summary"). Dette feltet kombinerer produktets viktigste egenskaper til en sammenhengende avsnittstekst. Når chatboten gjør semantiske søk, treffer den fritekstsammendraget med høy presisjon, samtidig som den kan lese de eksakte tallverdiene fra de tilhørende nøkkel-verdi-parene.
Før (vanskelig for RAG) kontra etter (selvstendig objekt):
// Before
{ "specs": [{ "id": 1, "v": "27" }] }
// After
{
"product_name": "Acme Monitor 27 Pro",
"sku": "MON-27-PRO",
"screen_size_inches": 27,
"vesa_mount_mm": "100x100",
"weight_kg": 5.2,
"price_incl_vat_nok": 4490,
"ai_summary": "Acme Monitor 27 Pro is a 27-inch display with VESA 100x100 mounting, weighing 5.2 kg, priced at 4490 NOK incl. VAT."
}Sammenligning av katalogformater for AI-oppslag
Valget mellom ulike filformater avhenger av hvor kompleks produktdataen din er, og hvor ofte den oppdateres. Tabellen nedenfor viser hvordan ulike katalogformater (uten å navngi konkrete eksterne verktøy) påvirker svarpresisjonen og risikoen for hallusinasjoner.
| Format | Svarpresisjon | Hallusinasjonsrisiko | Anbefalt bruksområde |
|---|---|---|---|
| Rå ERP-eksport (CSV) | Lav | Høy | Ikke anbefalt for direkte AI-trening uten vask |
| Flatstrukturert CSV med eksplisitte felter | Høy | Lav | Ideelt for store produktkataloger og e-handel |
| Semantisk nøkkel-verdi JSON | Svært høy | Minimal | Beste valg for komplekse tekniske spesifikasjoner |
Som tabellen viser, gir både flatstrukturert CSV og semantisk JSON langt lavere feilrate enn rå databaseeksporter. Ved å investere litt tid i et skript som vasker og omstrukturerer produktfilene før opplasting, sparer du kundene dine for feilinformasjon og kundesenteret for oppretting av feilbestillinger.
Kvalitetssikring og opplasting i praksis
Når filen er ferdig strukturert, bør du gjennomføre en systematisk kvalitetssikring før chatboten publiseres for kundene. Test chatboten med spørsmål som krever oppslag på tvers av nærliggende rader, slik som å sammenligne spesifikasjoner på to lignende modeller eller sjekke om et tilbehør passer til en bestemt hovedmodell.
Bruk verktøy som støtter kildehenvisninger og RAG-teknologi, slik at du direkte i grensesnittet kan verifisere hvilken tekstblokk eller datatabell chatboten baserer svaret sitt på. Dersom du ser at chatboten henter feil rad, kan du justere kolonnenavnene eller øke tydeligheten i produktbeskrivelsen.
Med Chatlys verktøy kan du enkelt laste opp CSV- og JSON-filer direkte, eller kombinere dem med nettside-crawling og PDF-er. Plattformen deler opp dataene på en måte som bevarer kildekonteksten, slik at bedriften din får en 24/7 salgsassistent som svarer presist på priser, lagerstatus og tekniske detaljer.
Klar for å gjøre produktkatalogen om til en treffsikker AI-assistent? Test Chatly gratis eller ta kontakt med teamet vårt for å se hvordan strukturert produktdata kan løfte e-handelen din.