High Speed Language Processing

Kwalitatieve data is essentieel voor het trainen van taalmodellen; Data die schoon is en demonstreert wat het model moet worden aangeleerd. Het opschonen van data is een uitdaging op zich. Data van het internet is doorgaans een ongestructureerd wild westen. Idealiter zet je de capabiliteiten van LLMs in voor het opschonen van data, maar zijn deze te traag en te kostbaar voor het tokenvolume. High Speed Natural Language Processing is een alternatief wat taalkennis met snelheid combineert. Met autoresearch optimaliseerden we part-of-speech tagging richting 330.000 tokens/sec in een single-thread CPU scenario. Hiermee brengen we kostbare analyses terug van weken naar dagen.


Agentic Conversational Analytics

Het bouwen van analytics dashboards is doorgaans tijdrovend. Je moet potentiële inzichten bedenken, data verzamelen, data bewerken, query's ontwerpen en visualisaties maken. Agentic Conversational Analytics neemt een groot deel van de tijdsbesteding van het engineeren achter analytics weg. Geïnspireerd op de principes van RLMs (Recursive Language Models) bepalen agents -gegeven enkel een analytische vraag van een gebruiker- direct en betrouwbaar een strategie en een executieplan om inzichten uit data te ontsluiten en te visualiseren, waarbij zonodig tools en subagents tijdens dit pad direct worden ontwikkeld.

Het dynamische besturingssysteem

Generatieve AI maakt het steeds makkelijker en betrouwbaarder om software on demand te genereren. Maar wat betekent dit binnen het besturingssysteem? Wat nu als iedereen simpelweg zijn benodigde tools en accessoires simpelweg zelf kan genereren, i.p.v. traditioneel te moeten downloaden en installeren? En iedere tool naar eigen wensen kan aanpassen? Dit leidde tot het concept van het dynamische besturingssysteem. En daaraan kon natuurlijk de vraag voor een minesweeper variant niet ontbreken.

GA Reinforced Embedding Classifiers

Genetische algoritmen (GA) kunnen een belangrijke rol spelen in het robuust trainen van Deep learning-modellen voor classificatie met vector embeddings. Door tijdens het trainingsproces automatisch adverserial embeddings te identificeren en zwakheden in de classifier direct op te sporen en te corrigeren wordt het model gedwongen een robuuste beslissingsgrens te leren. De kans op ongewenste misclassificatie wordt hierbij sterk verminderd, en de weerbaarheid van het model in het bijzonder voor out-of-domain (OOD) examples vergroot.

Effectiever trainen van Nederlandstalige taalmodellen

Met bewuste, vanuit de taalkunde gekozen bewerkingen op de Nederlandse taal en het tokenizerproces zijn transformers effectiever te trainen voor het Nederlands. We doen hierbij een aantal symbolische bewerkingen die de distributie van de tokens aanzienlijk verbeteren ten voordele van het trainingsproces en eenvoudig in de output kunnen worden omgedraaid zonder de betekenis van taal te veranderen. We concentreren kennis en verminderen ambiguïteit van tokens met computationeel efficiënte NLP technieken.

Lees meer: Effectiever trainen van Nederlandstalige taalmodellen

Ensemble Learning voor chatbots

Een chatbot die bestaat uit 1000 kleine neurale netwerken, klinkt in de tijd van grote modellen misschien vergezocht. Toch bieden ensembles van neurale netwerken enorm veel voordelen. Kleine onderdelen zijn makkelijker en apart te (her)trainen en de totale ensemble kan een groter model in performance benaderen en zelfs overschrijden. En geeft het boek "A Thousand Brains: A New Theory of Intelligence" van Jeff Hawkins (e-book) ons misschien al een indicatie dat het menselijk brein net zo werkt? We trainden al effectief chatbots met duizenden intents, en kunnen we dit nog verder opschalen op standaard hardware? Kunnen we tevens ons eerdere succes op het gebied van microbots hier toepassen?

Semantic Instruct

Hoe kan je de gespreksvrijheid van open dialoog met een Large Language Model (LLM) benutten en kaderen in bruikbare en doelgerichte dialogen voor bedrijven? Recentelijk experimenteerden wij met een veelbelovende methodiek die we zelf "semantic instruct" noemen. In tegenstelling tot traditionele chatbot flows, waarbij elke vraag in een dialoog letterlijk wordt afgevangen en opgevoerd, heeft semantic instruct een monitorend karakter en stuurt bij in vorm van instructies i.p.v. vooropgestelde antwoorden.

Information Pieces

Large Language Models hebben afgelopen jaar op samenvattingsgebied indrukwekkende resultaten laten zien, maar missen nog altijd een belangrijk punt: zekerheid. Een samenvatting waar je niet zeker kan zeggen of de belangrijkste onderwerpen in de samenvatting voorkomen, vermindert het aantal toepasbare use-cases drastisch. Information Pieces is een samenvattingsstrategie die ons helpt meer consistentere en begrijpbaar blijvende samenvattingen te schrijven.

Lees meer: "Wie A zegt moet ook B zeggen"

Robust Language Modelling

Predictieve taalmodellen proberen hun foutmarge te verkleinen met behulp van een enorme hoeveelheid data, waarbij de aanname is dat de massa van data een representatie is van het correcte antwoord. Het nabootsen van data maakt deze modellen zeer gevoelig voor het napraten van een dataset, waarbij het fundament of achterliggende redenatie tussen input en output niet goed wordt aangeleerd. In ons huidig onderzoek en ontwikkeling van Voice Marker II bouwen we geheel nieuwe methodieken voor het robuust opbouwen van feitelijke kennis met een sterker redenatie- en referentiekader.

Tekstverbanden met coreferentie

In onze taaltechnologie speelt coreferentie een essentiële rol. Met onze oplossingen voor coreferentie kunnen we de belangrijkste verbanden in tekst beter herkennen en leggen we een basis die de samenhang van een verhaal beter begrijpt om bijvoorbeeld een betere samenvatting te maken, een chatbot-gesprek beter te begrijpen, een uitgebreide vraag op te lossen en meer kennis te leren uit tekst op een gestructureerde manier.

Streaming NLP

Streaming NLP maakt natuurlijke taalverwerking mogelijk in de meest vroege stadia van de zin, direct vanaf de eerste woorden. Streaming NLP stapt af van de stapsgewijze, gelaagde manier van taalverwerking van traditionele NLP-systemen. Tijdens de seriële verwerking is directe informatie-uitwisseling tussen tokenization, POS- en NER-tagging mogelijk, resulterend in betere verwerking. De technologie reduceert de complexiteit van ons NLP-systeem aanzienlijk en de snellere verwerking biedt potentie voor real-time toepassingen.

Lees meer: "Streaming NLP"

Flexibele chatbots met Microbot architectuur

Geïnspireerd op schaalvoordelen uit de natuur en ICT vormen microbots samen de elementaire bouwstenen voor grotere en geavanceerdere bots. Met microbots verleggen we de grens van bots met gesloten gestuurde dialogen, naar geavanceerdere use-cases met open en wederzijdse communicatiemogelijkheden. De architectuur is uitermate geschikt voor educatieve en informatieve domeinen waarbij het gesprek kan worden gevoerd over de content zonder het gesprekspad te willen vastleggen.

Lees meer: Wat zijn microbots?

Betere beurtwisseling met Response Sensing

Veel chatbots communiceren volgens een om-en-om principe en voelen daarmee onnatuurlijk aan. Een gesprek is spreken en luisteren wanneer dat nodig is. Response Sensing is een technologie waarbij een chatbot automatisch detecteert wanneer het zijn beurt is om te spreken. Je kan zo makkelijker meerdere dingen tegen de chatbot zeggen zonder storende onderbrekingen.

Lees meer: Wat is Response Sensing?

Webpage Awareness: chatbots die de webpagina begrijpen

Webpage Awareness is een technologie die het mogelijk maakt op een website een chatbot rekening te laten houden met de pagina-inhoud. Hiermee verleggen we de grens van een chatbot als los communicatiekanaal op een website naar het ontwerp van chatbotdialogen die kunnen gaan over een pagina. Omdat de chatbot "ziet" wat een gebruiker ziet, maak je een gesprek een stuk relevanter. Weet het onderwerp al voor een gesprek begint, geef aanvullende informatie en stel minder onnodige tegenvragen.

Onderzoek en innovatie in AI & taaltechnologie

We werken aan complexe en uitdagende vraagstukken in Conversational AI en Nederlandstalige taaltechnologie. Hieronder valt o.a. Natural Language Processing en ontwikkelen we onafhankelijke technologie die hierbij kan assisteren. NLP wordt o.a. ingezet in tekstanalyse en dataset cleanup.

Meer Natural Language Processing