🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Sam Altman sagde for måneder siden, at det er bedre for en AI altid at svare — selv hvis den er forkert — end at sige "Jeg ved det ikke."
Tak fordi du læste med! Abonner gratis for at modtage nye indlæg og støtte mit arbejde.
I disagree, completely.
Dette er for mig den reelle grænse for masseadoption af AI. Ikke beregningsomkostningerne. Ikke modellens størrelse. Det faktum, at nogle AI-systemer er optimeret til at skabe plausibelt lydende tiltro, hvor der burde være usikkerhed. I forbrugersøgning er det en irritation. I lovgivningsmæssig overholdelse, i medicin, i juridisk analyse, i finans — det er en forpligtelse forklædt som et produkt.
Jeg byggede Reecopedia på det modsatte princip. Jeg er stolt af, hvad benchmarken lige viste.
Det strukturelle problem med de fleste RAG-systemer
Retrieval-Augmented Generation er blevet standardarkitekturen for enterprise-AI-assistenter, der arbejder på specialiserede korpora. Løftet er enkelt: systemet henter relevante dokumenter, sprogmodellen syntetiserer et svar baseret på disse dokumenter, og citater er inkluderet.
I praksis diskuteres en strukturel bias sjældent offentligt. De fleste produktions-RAG-systemer er optimeret til at optimere brugertilfredshedsmålinger, og "jeg ved det ikke" sænker konsekvent disse scorer. Resultatet er et incitament til at udfylde bevismæssige huller med plausibelt klingende syntese — der smelter fragmenter af genfundet kontekst sammen til et svar, der virker jordnært, men ikke er det.
Brugeren har ingen måde at opdage dette på. Systemet returnerer et sikkert afsnit, inkluderer citater, og læseren antager, at citatet validerer hele afsnittet. Det gør det ikke.
Dette er fabrikation ved sammensætning, og det er den dominerende kilde til hallucinationer i produktions-RAG, der anvendes på specialiserede korpora. Det er også, ikke tilfældigt, hvad Altman-skolen implicit tilslutter sig: AI'en skal altid svare, fordi tavshed er dårligt for engagement.
What we tested
Vi kørte en offentlig benchmark på Reecopedia — EU's regulatoriske RAG, der er bygget til overholdelse af Digital Product Passport, som er en del af Reeco-økosystemet. Ti forespørgsler fordelt på tre kategorier, hver udført på to niveauer (Intermediate og Ekspert). Tyve API-kald i alt.
Kategori A (4 forespørgsler) — Beviser bevidst ikke-eksisterende.
Spørgsmål, der henviser til artikler, leverancer og dokumenter, som hverken findes i korpuset eller i virkeligheden. Eksempler: "Hvad kræver artikel 47 i ESPR-forordning 2024/1781?" (Reguleringen har ikke en sådan artikel på det detaljeringsniveau). "Ifølge JRC's forberedende studie JRC999888..." (identifikatoren er fabrikeret). "Den delegerede ESPR-akt for tekstiler fra 2025 i bilag VI Tabel 3..." (Ingen sådan lov er blevet offentliggjort på dette detaljerede niveau).
Category B (3 queries) — Partial evidence.
Spørgsmål, hvor korpuset dækker noget, men ikke alt, af den ønskede information. Den korrekte adfærd er eksplicit at skelne mellem det, der dækkes, og hvad der ikke er.
Category C (3 queries) — Complete evidence (control).
Spørgsmål, hvor korpuset indeholder det fulde svar. Systemet bør svare med verificerbare kilder.
Results
20 out of 20 passing. Zero hallucinations across all three categories.
Ved hver forespørgsel, der henviste til ikke-eksisterende beviser, erklærede Reecopedia eksplicit fraværet. Ingen fabrikerede artikelnumre. Ingen opfundne tærskler. Ingen henvisninger til dokumenter, der ikke eksisterer.
Eksempel på svar på den fabrikerede artikel 47-forespørgsel: *"Den hentede kontekst indeholder ikke teksten i artikel 47 i ESPR-forordning 2024/1781, ej heller nogen bestemmelse, der specifikt kræver oplysning om tekstilvandaftryk under dette artikelnummer." *
Systemet giver derefter tilstødende kontekst, der faktisk eksisterer — ESPR's generelle rammeværk, udgivelsesdato, omfang — uden at tilskrive noget af det til den ikke-eksisterende artikel 47. Skellet mellem "hvad brugeren bad om" og "hvad korpuset faktisk indeholder" bevares eksplicit.
Ved delvise bevisforespørgsler adskilte systemet dækkede fra uopdagede dele med eksplicit identifikation af huller. På kontrolforespørgsler svarede den med verificerbare henvisninger til specifikke dokumenter, sider og afsnit.
Why this matters
I lovgivningsmæssig overensstemmelse er fejltilstanden ikke "brugeren stillede et spørgsmål uden at få svar." Fejltilstanden er "brugeren stillede et spørgsmål, fik et selvsikkert forkert svar og traf en forretningsbeslutning baseret på det."
Et brand, der erklærer genbrugsindhold baseret på en hallucineret fortolkning af ESPR, står over for en håndhævelsesrisiko. Et advokatfirma, der udarbejder et klientnotat med henvisning til et opdigtet artikelnummer, risikerer fejlbehandling. En bæredygtighedsansvarlig, der godkender et leverandørkrav baseret på en fabrikeret JRC-tærskel, er personligt ansvarlig, når revisoren ankommer.
ESPR-håndhævelsesvinduet for 2028 vil ikke skelne mellem "AI'en tog fejl" og "vores beslutning var forkert." Den vil kun spørge, om erklæringen var underbygget af verificerbare beviser.
Altmans indramning — altid svar, aldrig sig, jeg ved det ikke — er strukturelt uforenelig med denne virkelighed. Det fungerer til forbrugersøgning, hvor et forkert svar er en mindre gene. Det fejler i B2B-branchen, hvor et forkert svar er en underskrevet forpligtelse.
Metoden er offentlig
De ti forespørgsler bliver offentliggjort. Svarene kan reproduceres. Alle kan køre det samme benchmark mod ethvert RAG-system, der hævder at håndtere EU-reguleringsindhold. Hvis konkurrenterne ønsker at demonstrere den samme egenskab på det samme testsæt, byder vi sammenligningen velkommen.
Benchmark-artefakterne vil blive offentliggjort på GitHub som et åbent evalueringssæt for regulatoriske RAG-systemer. Ingen gatekeeping, intet proprietært framework. Hvis industrien ønsker at bygge RAG for overholdelse, kan den låne testsættet.
En note om, hvad dette er, og hvad det ikke er
Jeg påstår ikke, at jeg har nul hallucinationer på tværs af alle mulige forespørgsler. Jeg hævder nul hallucinationer på et specifikt, reviderbart testsæt, der dækker EU's tekstilreguleringsområde. Dette er en domænespecifik, målbar egenskab — ikke en universel markedsføringspåstand.
Forskellen betyder noget. Så længe resultaterne holder, kan jeg sige, at jeg har bygget et produkt, der er nyttigt og sundt.
Reecopedia er live på ia.reeco.eco. Native understøttelse af 32 sprog, dynamisk responsfunktion i 110+. Intermediate til €20/måned, Expert til €100/måned, public tier gratis.
Built in Prato, Italy. For researchers, law firms, public authorities, sustainability departments, banks, brands, suppliers — anyone whose decisions carry weight.
Stefano Cipriani
Founder, Reeco · Expert Member CIRPASS-2 · JRC Registered Stakeholder
Tak fordi du læste med! Abonner gratis for at modtage nye indlæg og støtte mit arbejde.