De ontologie, het waarheidskader van BrainDup
De AI stelt voor, de ontologie en de code beslissen.
Een kaart van feiten, geen aannemelijke tekst
BrainDup zet een documentarchief (gescande pdf's, webpagina's, rapporten, e-mails) om in een doorzoekbare kennisgraaf. In plaats van een assistent die aannemelijke tekst verzint, bouwt het een kaart van de feiten die werkelijk in uw documenten staan, elk verbonden met zijn exacte bron.
De ontologie is het plan van die kaart, gekozen voordat er ook maar één lijn getekend wordt.
Voordat één document gelezen is, stelt BrainDup een eenvoudige vraag: wat is het vocabulaire van uw domein? Dat vocabulaire, de soorten entiteiten en de verbanden die ertussen kunnen bestaan, staat in een bestand in de standaardvorm van het semantische web: dezelfde OWL die kennisgrafen al twintig jaar structureert. Bij ons heet dat bestand een pack.
Het mechanisme, in drie tijden
1. Het pack wordt gekozen
BrainDup levert kant-en-klare packs voor meerdere sectoren (cultureel erfgoed, vastgoed, zorg, recht, evenementen), over te nemen zoals ze zijn of aan te passen. U begint niet bij een blank blad.
2. Het pack gaat op slot voor het hele corpus
Dat is geen instelling in de marge: het is de grens tussen wat de AI mag beweren en wat niet. Het vocabulaire is niet meer onderhandelbaar terwijl de documenten binnenkomen.
3. De code beslist, nooit het model
Bij het lezen van een document stelt het taalmodel entiteiten en verbanden voor. Een deterministische code beslist of elk voorstel de graaf binnenkomt: het wordt aanvaard als het overeenkomt met een type uit het pack en zich vasthaakt aan een precies stuk van het brondocument. Zo niet, dan valt het af.
Dat mechanisme maakt de kernbelofte van BrainDup houdbaar: elke bewering verwijst naar een verifieerbare bron, en een antwoord waarvan de bron niet vaststaat wordt nooit met een verzinsel aangevuld; het wordt een eerlijke weigering. Hetzelfde beginsel bestuurt de door code samengestelde bronvermeldingen en draagt ons antwoord op de AI Act.
Wat de ontologie concreet verandert
| Zonder ontologie | Met een pack van BrainDup | |
|---|---|---|
| Vocabulaire | Onderweg bepaald door het model | Vastgelegd vóór het inlezen, gelijk voor het hele corpus |
| Onbekende entiteit | Stil aangemaakt, dubbels stapelen zich op | Afgewezen als ze met geen enkel aangegeven type overeenkomt |
| Verbanden | Afgeleid uit de nabijheid van woorden | Van een type; oorzakelijkheid vergt een uitdrukkelijke uitspraak of een menselijke bevestiging |
| Homoniemen | « Mercurius » versmelt planeet, metaal en persoon | Elke betekenis is een eigen entiteit, zonder twijfel te herkennen |
| Traceerbaarheid | De bron wordt achteraf gereconstrueerd | Een feit zonder aanhechtbare passage komt de graaf niet binnen |
| Samenhang | Onzichtbaar zolang niemand herleest | Tegenspraak wordt opgemerkt tegen de regels van het pack |
Anders gezegd: de ontologie maakt het model niet slimmer, ze verkleint het oppervlak waarop het zich kan vergissen.
Wat een ontologie precies is
Het woord verwijst hier niet naar de tak van de wijsbegeerte, maar naar iets heel concreets: de formele, uitdrukkelijke en gedeelde specificatie van een begrippenkader. Een logisch woordenboek met een bouwplan erbij, voor een bepaald domein. Het vervult vier taken.
Ze omschrijft de begrippen
In een advocatenkantoor: « Dossier », « Partij », « Wettekst ». In een erfgoedarchief: « Plaats », « Persoon », « Vakkennis », « Gebeurtenis ». Elke klasse draagt haar eigen kenmerken.
Ze beschrijft verbanden met een type
Waar een hiërarchische indeling enkel zou zeggen « griep hoort bij virusziekten », drukt de ontologie uit: behandelt, veroorzaakt, tegenaangewezen bij, toegediend door.
Ze heft dubbelzinnigheid op
Mercurius is een planeet, een metaal, een Romeinse god en een zanger. Een mens beslist in een fractie van een seconde; een machine kan dat enkel als elke betekenis als een eigen entiteit is aangegeven.
Ze dient als ontmoetingspunt
Twee databanken die apart zijn ontworpen, met andere veldnamen, richten zich op dezelfde ontologie. Elk houdt haar eigen structuur, beide worden leesbaar voor dezelfde programma's.
Een bewezen erfenis, geen eigen vinding
Het idee komt van Tim Berners-Lee. De uitvinder van het web formuleert al in de jaren 1990 de ambitie van een web waarvan de gegevens door machines te begrijpen zijn, en publiceert de bekendste uitwerking in 2001 in Scientific American, met James Hendler en Ora Lassila. Zijn doel past in één zin: het web van een netwerk van documenten naar een netwerk van kennis brengen, wat hij in 2007 de Giant Global Graph zal noemen.
Een hyperlink drukt namelijk geen betekenis uit: hij zegt « ga daar kijken », nooit « dit is de werkgever van deze persoon ». De onderdelen hieronder zijn gemaakt om dat gat te dichten. Het zijn standaarden van het W3C, meer dan tien jaar in productie. BrainDup vindt geen eigen formalisme uit: het past dat toe op uw archief.
Elk ding een uniek adres geven
Het klassieke web geeft pagina's een identificatie. Het semantische web geeft die ook aan begrippen: een persoon, een geneesmiddel, een gemeente. Twee systemen die dezelfde URI gebruiken, spreken met zekerheid over hetzelfde.
Feiten in drie woorden beschrijven
Alle informatie wordt uitgedrukt in een triplet: onderwerp, gezegde, voorwerp. Marie Curie / ontving / de Nobelprijs voor natuurkunde. Het onderwerp van het ene triplet wordt het voorwerp van het volgende, en de kennis verbindt zichzelf.
Het woordenboek en de regels opschrijven
RDF zegt wat er is; OWL zegt wat er kan zijn. Klassen die in elkaar zitten, verplichte of unieke verbanden, wederkerige verwijzingen, gelijkstelling van identificaties uit verschillende bronnen.
Vragen stellen aan de graaf
Het tegenhanger van SQL voor het semantische web. « Componistes geboren in Europa voor 1900 van wie een werk in Wenen is uitgevoerd »: geen enkele pagina bevat die lijst, de graaf stelt ze samen uit verspreide feiten.
Gevolgtrekking: wanneer de machine besluit zonder te gokken
OWL rust op beschrijvingslogica, streng genoeg om automatisch berekend te worden. Een gevolgtrekkingsmotor past de regels van de ontologie toe op de gegevens en trekt besluiten die nergens zijn opgeschreven.
De ontologie geeft aan dat « is ouder van » de omgekeerde is van « is kind van », en dat de ouder van een ouder een grootouder is. De databank bevat twee feiten: Anne is ouder van Julie, Julie is ouder van Leo. De motor besluit zelf dat Anne de grootmoeder van Leo is. Niemand heeft het ingevoerd, en toch is niets verzonnen: het besluit is aantoonbaar.
Het redeneren dient ook als vangrail. Stelt de ontologie dat een persoon maar één geboortedatum heeft en staan er twee in de databank, dan meldt de motor de tegenspraak. Het systeem merkt zijn eigen fouten op, een eigenschap die geen enkele hoeveelheid aannemelijke tekst oplevert.
Waar deze technieken al draaien
Zoekmachines
Het samenvattende kaartje naast uw resultaten komt uit een kennisgraaf. Het vocabulaire schema.org, in 2011 samen door de grote zoekmachines gelanceerd, laat sites zich zo verstaanbaar maken.
Zorg en levenswetenschappen
De grote medische terminologieën zijn ontologieën. Ze waarborgen dat een diagnose die in een Fins ziekenhuis wordt ingevoerd, hetzelfde betekent in een Portugese studie.
Onderzoek en open gegevens
De FAIR-beginselen, die de publicatie van wetenschappelijke gegevens structureren, rusten op deze standaarden om datasets vindbaar en herbruikbaar te maken voor programma's.
Erfgoed en bibliotheken
Catalogi, archieven en musea publiceren hun collecties als verbonden gegevens: men gaat van een auteur naar zijn werken, dan naar de plaatsen en de tijdvakken. Dat is het terrein van onze erfgoedpacks.
Wat ontologieën kosten
De eerlijkheid gebiedt het te zeggen: de visie van een wereldwijd semantisch web, in 2001 geformuleerd, is op die schaal niet uitgekomen. Een ontologie bouwen kost geld, vraagt vakkennis en veronderstelt een moeizaam bereikte overeenstemming. Het semantische web is dus in eilanden tot stand gekomen: erg stevig waar strengheid van levensbelang is (zorg, financiën, industrie, recht, onderzoek), losser elders.
Dat is precies wat de packs aanpakken: in plaats van een blank blad bij elk project, wordt een bestaand sectorvocabulaire overgenomen, verfijnd en hergebruikt. En de ambitie verschuift van schaal: geen wereldwijde graaf, maar een eigen, soevereine en verifieerbare graaf, gebouwd voor uw organisatie.
Wat is het vocabulaire van uw domein?
Dat is de eerste vraag die wij stellen, en het antwoord bepaalt al het overige. Dertig minuten zijn genoeg om te weten of een bestaand pack uw archief dekt, of dat het uitgebreid moet worden.