IA Act Applicable depuis le 2 août 2026 : les preuves que BrainDup produit. Voir la conformité

De ontologie, het waarheidskader van BrainDup

De AI stelt voor, de ontologie en de code beslissen.

Een kaart van feiten, geen aannemelijke tekst

BrainDup zet een documentarchief (gescande pdf's, webpagina's, rapporten, e-mails) om in een doorzoekbare kennisgraaf. In plaats van een assistent die aannemelijke tekst verzint, bouwt het een kaart van de feiten die werkelijk in uw documenten staan, elk verbonden met zijn exacte bron.

De ontologie is het plan van die kaart, gekozen voordat er ook maar één lijn getekend wordt.

Voordat één document gelezen is, stelt BrainDup een eenvoudige vraag: wat is het vocabulaire van uw domein? Dat vocabulaire, de soorten entiteiten en de verbanden die ertussen kunnen bestaan, staat in een bestand in de standaardvorm van het semantische web: dezelfde OWL die kennisgrafen al twintig jaar structureert. Bij ons heet dat bestand een pack.

Het mechanisme, in drie tijden

1. Het pack wordt gekozen

BrainDup levert kant-en-klare packs voor meerdere sectoren (cultureel erfgoed, vastgoed, zorg, recht, evenementen), over te nemen zoals ze zijn of aan te passen. U begint niet bij een blank blad.

2. Het pack gaat op slot voor het hele corpus

Dat is geen instelling in de marge: het is de grens tussen wat de AI mag beweren en wat niet. Het vocabulaire is niet meer onderhandelbaar terwijl de documenten binnenkomen.

3. De code beslist, nooit het model

Bij het lezen van een document stelt het taalmodel entiteiten en verbanden voor. Een deterministische code beslist of elk voorstel de graaf binnenkomt: het wordt aanvaard als het overeenkomt met een type uit het pack en zich vasthaakt aan een precies stuk van het brondocument. Zo niet, dan valt het af.

Dat mechanisme maakt de kernbelofte van BrainDup houdbaar: elke bewering verwijst naar een verifieerbare bron, en een antwoord waarvan de bron niet vaststaat wordt nooit met een verzinsel aangevuld; het wordt een eerlijke weigering. Hetzelfde beginsel bestuurt de door code samengestelde bronvermeldingen en draagt ons antwoord op de AI Act.

Wat de ontologie concreet verandert

Zonder ontologieMet een pack van BrainDup
VocabulaireOnderweg bepaald door het modelVastgelegd vóór het inlezen, gelijk voor het hele corpus
Onbekende entiteitStil aangemaakt, dubbels stapelen zich opAfgewezen als ze met geen enkel aangegeven type overeenkomt
VerbandenAfgeleid uit de nabijheid van woordenVan een type; oorzakelijkheid vergt een uitdrukkelijke uitspraak of een menselijke bevestiging
Homoniemen« Mercurius » versmelt planeet, metaal en persoonElke betekenis is een eigen entiteit, zonder twijfel te herkennen
TraceerbaarheidDe bron wordt achteraf gereconstrueerdEen feit zonder aanhechtbare passage komt de graaf niet binnen
SamenhangOnzichtbaar zolang niemand herleestTegenspraak wordt opgemerkt tegen de regels van het pack

Anders gezegd: de ontologie maakt het model niet slimmer, ze verkleint het oppervlak waarop het zich kan vergissen.

Wat een ontologie precies is

Het woord verwijst hier niet naar de tak van de wijsbegeerte, maar naar iets heel concreets: de formele, uitdrukkelijke en gedeelde specificatie van een begrippenkader. Een logisch woordenboek met een bouwplan erbij, voor een bepaald domein. Het vervult vier taken.

Ze omschrijft de begrippen

In een advocatenkantoor: « Dossier », « Partij », « Wettekst ». In een erfgoedarchief: « Plaats », « Persoon », « Vakkennis », « Gebeurtenis ». Elke klasse draagt haar eigen kenmerken.

Ze beschrijft verbanden met een type

Waar een hiërarchische indeling enkel zou zeggen « griep hoort bij virusziekten », drukt de ontologie uit: behandelt, veroorzaakt, tegenaangewezen bij, toegediend door.

Ze heft dubbelzinnigheid op

Mercurius is een planeet, een metaal, een Romeinse god en een zanger. Een mens beslist in een fractie van een seconde; een machine kan dat enkel als elke betekenis als een eigen entiteit is aangegeven.

Ze dient als ontmoetingspunt

Twee databanken die apart zijn ontworpen, met andere veldnamen, richten zich op dezelfde ontologie. Elk houdt haar eigen structuur, beide worden leesbaar voor dezelfde programma's.

Een bewezen erfenis, geen eigen vinding

Het idee komt van Tim Berners-Lee. De uitvinder van het web formuleert al in de jaren 1990 de ambitie van een web waarvan de gegevens door machines te begrijpen zijn, en publiceert de bekendste uitwerking in 2001 in Scientific American, met James Hendler en Ora Lassila. Zijn doel past in één zin: het web van een netwerk van documenten naar een netwerk van kennis brengen, wat hij in 2007 de Giant Global Graph zal noemen.

Een hyperlink drukt namelijk geen betekenis uit: hij zegt « ga daar kijken », nooit « dit is de werkgever van deze persoon ». De onderdelen hieronder zijn gemaakt om dat gat te dichten. Het zijn standaarden van het W3C, meer dan tien jaar in productie. BrainDup vindt geen eigen formalisme uit: het past dat toe op uw archief.

URI

Elk ding een uniek adres geven

Het klassieke web geeft pagina's een identificatie. Het semantische web geeft die ook aan begrippen: een persoon, een geneesmiddel, een gemeente. Twee systemen die dezelfde URI gebruiken, spreken met zekerheid over hetzelfde.

RDF

Feiten in drie woorden beschrijven

Alle informatie wordt uitgedrukt in een triplet: onderwerp, gezegde, voorwerp. Marie Curie / ontving / de Nobelprijs voor natuurkunde. Het onderwerp van het ene triplet wordt het voorwerp van het volgende, en de kennis verbindt zichzelf.

RDFS en OWL

Het woordenboek en de regels opschrijven

RDF zegt wat er is; OWL zegt wat er kan zijn. Klassen die in elkaar zitten, verplichte of unieke verbanden, wederkerige verwijzingen, gelijkstelling van identificaties uit verschillende bronnen.

SPARQL

Vragen stellen aan de graaf

Het tegenhanger van SQL voor het semantische web. « Componistes geboren in Europa voor 1900 van wie een werk in Wenen is uitgevoerd »: geen enkele pagina bevat die lijst, de graaf stelt ze samen uit verspreide feiten.

Gevolgtrekking: wanneer de machine besluit zonder te gokken

OWL rust op beschrijvingslogica, streng genoeg om automatisch berekend te worden. Een gevolgtrekkingsmotor past de regels van de ontologie toe op de gegevens en trekt besluiten die nergens zijn opgeschreven.

De ontologie geeft aan dat « is ouder van » de omgekeerde is van « is kind van », en dat de ouder van een ouder een grootouder is. De databank bevat twee feiten: Anne is ouder van Julie, Julie is ouder van Leo. De motor besluit zelf dat Anne de grootmoeder van Leo is. Niemand heeft het ingevoerd, en toch is niets verzonnen: het besluit is aantoonbaar.

Het redeneren dient ook als vangrail. Stelt de ontologie dat een persoon maar één geboortedatum heeft en staan er twee in de databank, dan meldt de motor de tegenspraak. Het systeem merkt zijn eigen fouten op, een eigenschap die geen enkele hoeveelheid aannemelijke tekst oplevert.

Waar deze technieken al draaien

Zoekmachines

Het samenvattende kaartje naast uw resultaten komt uit een kennisgraaf. Het vocabulaire schema.org, in 2011 samen door de grote zoekmachines gelanceerd, laat sites zich zo verstaanbaar maken.

Zorg en levenswetenschappen

De grote medische terminologieën zijn ontologieën. Ze waarborgen dat een diagnose die in een Fins ziekenhuis wordt ingevoerd, hetzelfde betekent in een Portugese studie.

Onderzoek en open gegevens

De FAIR-beginselen, die de publicatie van wetenschappelijke gegevens structureren, rusten op deze standaarden om datasets vindbaar en herbruikbaar te maken voor programma's.

Erfgoed en bibliotheken

Catalogi, archieven en musea publiceren hun collecties als verbonden gegevens: men gaat van een auteur naar zijn werken, dan naar de plaatsen en de tijdvakken. Dat is het terrein van onze erfgoedpacks.

Wat ontologieën kosten

De eerlijkheid gebiedt het te zeggen: de visie van een wereldwijd semantisch web, in 2001 geformuleerd, is op die schaal niet uitgekomen. Een ontologie bouwen kost geld, vraagt vakkennis en veronderstelt een moeizaam bereikte overeenstemming. Het semantische web is dus in eilanden tot stand gekomen: erg stevig waar strengheid van levensbelang is (zorg, financiën, industrie, recht, onderzoek), losser elders.

Dat is precies wat de packs aanpakken: in plaats van een blank blad bij elk project, wordt een bestaand sectorvocabulaire overgenomen, verfijnd en hergebruikt. En de ambitie verschuift van schaal: geen wereldwijde graaf, maar een eigen, soevereine en verifieerbare graaf, gebouwd voor uw organisatie.

Wat is het vocabulaire van uw domein?

Dat is de eerste vraag die wij stellen, en het antwoord bepaalt al het overige. Dertig minuten zijn genoeg om te weten of een bestaand pack uw archief dekt, of dat het uitgebreid moet worden.