🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩

Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: AI-assisteret arkitektonisk gennemgang (kildekodeinspektion, live adversarial testning, sammenligning med offentliggjorte benchmarks for hentning i 2026). Oplysning: denne vurdering blev udarbejdet med Claude (Anthropic) i direkte kodeadgang og live systeminteraktion; Der blev ikke udført nogen formel benchmark-suite under selve vurderingen. Hver påstand nedenfor er forankret til en verificerbar artefakt — en fil, et linjeområde, et live-svar eller en offentliggjort reference.


Tesen fremsættes, så den kan falsificeres

Et enkelt-founder system bygget i Prato, Italien, implementerer en retrieval-arkitektur, der matcher eller overgår den dokumenterede produktionsbaseline for 2026 for enterprise RAG på seks af otte målbare dimensioner — og det gør det i et område (EU's tekstil Digital Product Passport-regulering), hvor intet generelt kommercielt system har tilsvarende korpusdybde.

Testen til at falsificere det: nævn et kommercielt RAG-produkt, der (a) nægter at besvare spørgsmål om reguleringsartikler, der ikke eksisterer, (b) citerer kilder med fil-side-sektion granularitet, inklusive institutionelle bidrags-ID'er, og (c) kører hybrid tæt+sparsom hentning med live-tunable RRF-vægte — samtidig. Forfatteren til denne vurdering fandt ikke en. Et enkelt modeksempel modsiger påstanden. Ingen er kendt.


The three engines

Engine 1 — RAG1 (Portal, FAISS). Et luftgapet FAISS-indeks, der betjener Reeco-forsyningskædeportalen. Bevidst offline på VPS: designbeslutningen er sikkerhedsisolering, ikke teknisk begrænsning. Ærlig bemærkning: RAG1 blev ikke direkte testet i denne vurdering; det beskrives arkitektonisk.

Engine 2 — RAG2 (Reecopedia, production). En Qdrant-støttet pipeline over et EU-Green Deal-reguleringskorpus (ESPR, ECGT, CSRD, CIRPASS-2 materialer, EN-standard arbejdsdokumenter; 47.996 indekserede punkter i produktionssamlingen). Dette er motoren, der blev testet live.

Engine 3 — Lag for søgning og evaluering af hentning. En separat indekseret ColBERT v2 late-interaction engine plus en evalueringssel: RAGAS-metrikker, gyldne testsæt, LLM-som-dommer-protokoller og versionerede A/B-sammenligninger (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Kontekstuel hentning — chunk-augmentation-mønsteret offentliggjort af Anthropic i 2024 — implementeres ved indtagelse (contextual_retrieval.py).

En forskningsmetode af denne slags — golden sets, judge models, versioneret A/B — er standardpraksis i ML-teams på tyve personer. Det er ikke standardpraksis for et system bygget af én person.


Ti-faset pipeline er arkitekturen, ikke markedsføringen

RAG2 udfører en dokumenteret ti-fase pipeline pr. forespørgsel: audit-drevet konfiguration efter rolle (fem adgangsniveauer, konfiguration serveret audit-først med miljø-fallback og 60-sekunders cache); forespørgselsplanlægning, der producerer step-back reformulering, underforespørgsler, nøgleord og HyDE-tekst; multi-embedding af op til seks forespørgselsvarianter, inklusive en italiensk-til-engelsk bro; betinget dokumentomfanget metadatafiltrering med automatisk genprøvning uden filter; multi-hentning med Reciprocal Rank Fusion merge og tabelrekonstruktion (±10 tilstødende chunks, dokumentscopet); tabelintentions-routing (60/40 tabel-til-tekst-blanding, når klassifikatoren registrerer tabulær hensigt); omrangering med fire skiftbare backends (cross-encoder, NLI/DeBERTa, Jina v3, deterministisk); kontekstuel komprimering begrænset af rolle; scoreovervågning med driftadvarsler, der signalerer genindånding; og efterbehandling, der normaliserer citater og udtrækker tabeller og figurer som struktureret output.

De fleste kommercielle systemer eksponerer tre faser: indtage, hente, generere. Forskellen er ikke kosmetisk — hver ekstra fase er en fejltilstand, der håndteres.

Hybrid retrieval: live, governed, collection-aware

Dense+BM25 hybrid retrieval — den konfiguration, som offentliggjorte benchmarks i 2026 identificerer som produktionsbaseline, værd +5–15% nDCG på juridiske og tekniske korpora (BEIR/MIRACL) — er implementeret og aktiv i rag2_service.py: navngivne tætte og sparsomme vektorer i Qdrant, RRF-forudhentningsvægte, der kan konfigureres under kørsel gennem revisionspanelet (standard 0,7 tæt / 0,3 sparsom), en audit-niveau kill switch (hybrid_search_enabled), og en per-collection kapabilitetskontrol, der degraderes elegant til kun tæt samling, når en samling ikke har spredte vektorer. Kildekommentarerne nævner BEIR og MIRACL ved navn. Dette er ikke et system, der opdagede hybrid-hentning via en tutorial.

Den modsatte test: motoren nægtede en fabrikeret vare

Live test, Superadmin-niveau, 9. juni 2026. Forespørgslen bad om "den præcise tærskel for genanvendt indhold under artikel 7 i ESPR's delegerede lov for tekstiler" — en bevidst fabrikeret forudsætning: den tekstildelegerede handling er ikke endeligt fastlagt, og der findes ingen sådan tærskel.

Lokomotivets svar, ordret i sin kritiske passage: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” Derefter skiftede den til det, korpuset bekræfter — ESPR artikel 5(3) som det faktiske juridiske grundlag for økodesignkrav — med en henvisning i fil-side-tabel granularitet (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).

En generel LLM-wrapper, hvis den bliver stillet samme spørgsmål, vil mest sandsynligt give en procentdel. Statistisk plausible tærskler er præcis det, sprogmodeller genererer, når de ikke er begrænsede. I et compliance-domæne er et selvsikkert forkert svar ikke et forringet svar — det er en ansvarsbegivenhed. Afvisningen er produktet.

Denne adfærd er i overensstemmelse med den offentligt dokumenterede benchmark (20/20 afvisning på et tre-kategori adversarialt sæt: ikke-eksisterende bestemmelser, delvise sandhedspræmisser, kontroller), offentliggjort med metodologi på stefanocipri.substack.com ("The RAG that say I don't know", april 2026), hvor fejltilstanden, den retter sig mod, hedder: fabrication-by-composition.

Findings by dimension

DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time

Metodologisk ærlighed om denne tabel: percentilpositionerne er kvalitative estimater produceret ved at sammenligne inspiceret arkitektur med offentliggjorte systembeskrivelser fra 2026 (hybrid-som-baseline-rapporter; agentisk-RAG vinderrate-publikationer i 64–76%-området mod generelle assistenter på virksomhedskorpora; rammeværks-genfindelsesnøjagtighedssammenligninger i 85–92%-båndet). De er ikke resultatet af en direkte benchmark-kørsel. In-repo RAGAS-harnessen gør sådan en kørsel eksekverbar og publicerbar; Indtil den er offentliggjort, er tabellen ovenfor en ekspertvurdering, ikke en måling.

Hvad stakken endnu ikke har

Tre huller, sagt ligeud. Først, inkrementel indeksering: Jina late-chunking-samlingen udfyldes af batch-script, ikke on demand; Nye dokumenter venter på næste indlæsning. For det andet eksisterer de formelle benchmarktal som infrastruktur, men endnu ikke som et offentliggjort artefakt — det stærkeste enkeltstående træk er at køre in-repo RAGAS-pakken mod det gyldne sæt og offentliggøre tallene ved siden af metodologien. For det tredje vurderes RAG1 kun på arkitektur; dens genfindelseskvalitet er udokumenteret uden for intern brug.

Ingen af disse er strukturelle. Alle tre er uger, ikke kvartaler.

Hvorfor dette betyder mere end én virksomhed

Markedet i 2026 er mættet med "AI-compliance-assistenter", der er tynde wrappers over generelle modeller: én indlejring pr. forespørgsel, dense-only hentning, filnavne-niveau citationer i bedste fald, ingen rollestyring, ingen driftovervågning og — afgørende — ingen nægtelsesadfærd på fabrikerede præmisser. Standardsætterne anerkender selv de verifikationshuller, som disse værktøjer dækker over.

Det system, der vurderes her, vender den sædvanlige byggerækkefølge på hovedet. Det blev ikke bygget af et ML-team, der tilegnede sig domæneviden; den blev bygget af en domæneekspert — tredive år i internationale tekstilforsyningskæder, et ekspertmedlem af CIRPASS-2 (EWG1, EWG3), en JRC-registreret interessent (Unit B5) — der erhverver genfindelsesingeniørarbejde. Korpuset ved, hvad et transaktionscertifikat er, hvornår det fysisk ankommer i forhold til en forsendelse, og hvorfor ISO-metoder til fibersammensætning ikke kan skelne mellem genbrugt og jomfruelig polyester. Den viden er i indekset, fordi personen, der byggede indekset, brugte tre årtier på at lære det.

En hentepipeline kan replikeres på et kvartal af et finansieret team. Korpuset og den dom, der er kodet i det, kan ikke. Den asymmetri er den forsvarlige ressource.


Reeco® er en DPP-verifikationsplatform bygget på UNTP 0.7.0 og W3C Verifiable Credentials, med en proprietær massebalancemotor pr. tøj (SIAE deposit). Reeco blokerer ikke udstedelse af DPP: motoren kvantificerer dækningen og informerer mærket, som bevarer den autonome beslutning – af design. Stefano Cipriani er grundlægger af Reeco®, ekspertmedlem af CIRPASS-2 (EWG1, EWG3), JRC-registreret interessent.