Taaltechnologieën openen de toegangspoort tot een meer verbonden, innovatief en toegankelijk Europa.
Taaltechnologieën (LT) stellen machines niet alleen in staat om menselijke taal te lezen, te analyseren, te verwerken en te genereren, maar ook om, dankzij recente wetenschappelijke ontwikkelingen, de kloof tussen menselijke communicatie en machinebegrip te overbruggen.
Aangezien taal dient als het fundamentele medium voor menselijke interactie, heeft LT enorm belang gekregen in verschillende industrieën en toepassingen, van vertaling en lokalisatie tot klantenondersteuning, gezondheidszorg, mediacreatie en marketing. Veelvoorkomende voorbeelden van deze technologie zijn spraakherkenning, slimme assistenten, machinevertaling, chatbots, tekstsamenvatting en automatische ondertiteling.
Wat is er nodig om taaltechnologieën te ontwikkelen?
Hieronder staan enkele van de belangrijkste elementen voor de ontwikkeling van taalgebaseerde instrumenten en diensten.
- Taalgegevens: dit verwijst naar de tekstuele of gesproken inhoud – in een of meer talen – die dient als input- of opleidingsmateriaal voor taken op het gebied van de verwerking van natuurlijke talen, bijvoorbeeld het genereren van tekst of sentimentanalyse. Deze gegevens kunnen afkomstig zijn uit verschillende bronnen – boeken, artikelen, posts op sociale media, transcripties van gesproken gesprekken, enz. Aangezien zij de basis vormen voor de ontwikkeling van LT, is het van vitaal belang dat zij worden verzameld met volledige inachtneming van de bepalingen inzake auteursrecht (IPR) en bescherming van persoonsgegevens (AVG).
- Opleidingsalgoritmen en taalmodellen: algoritmen zijn de software, de “recepten”, om modellen van menselijke talen te maken. Met aanzienlijke hoeveelheden kwaliteitsgegevens hebben de nieuwste Machine Learning-algoritmen aangetoond dat ze meer mogelijkheden hebben om modellen te maken die de kennis vertegenwoordigen die is afgeleid van taalgegevens. Hoe groter de middelen en modellen zijn, hoe omvattender en algemener hun toepassingen zijn.
- rekenkracht: er zijn aanzienlijke computationele middelen nodig, met name tijdens de ontwikkeling van taalmodellen, waar high-performance computing en robuuste cloudinfrastructuren van cruciaal belang zijn.
- Menselijke deskundigheid: succesvolle LT omvat samenwerking tussen taalkundigen, datawetenschappers, computeringenieurs en domeinspecialisten.
Wat doet Europa om taaltechnologieën te ontwikkelen?
In Europa hebben we een complex taallandschap. Het Handvest van de grondrechten van de Europese Unie verbiedt discriminatie op grond van taal en legt de EU de verplichting op de taalkundige verscheidenheid te eerbiedigen. Verantwoordingsplicht, transparantie, billijkheid en respect voor onze waarden zijn slechts enkele van de ethische implicaties ervan. Deze rechten en principes kunnen alleen worden gegarandeerd door een onbevooroordeeld gebruik van LT.
De Europese LT-industrie speelt een sleutelrol in de strategische en technologische autonomie van Europa, die verder moet worden versterkt. Onze specifieke marktbehoeften zijn het best bekend bij Europese LT p roviders, waarvan er honderden zijn opgenomen in de Catalogus van eTranslation Services.
Publiek beschikbare oplossingen, met inbegrip van door de Europese Commissie aangeboden instrumenten en diensten, vullen het marktaanbod aan en verhelpen tegelijkertijd een tekort aan technologische ondersteuning voor talen met weinig middelen. Deze basisoplossingen — machinevertaling (eTranslation), naamsbekendheid, samenvatting, spraaktranscriptie en gegevenspseudonimisering voor naleving van de AVG — zijn beschikbaar voor alle Europese overheidsdiensten en kleine en middelgrote ondernemingen in alle officiële talen.
In het kader van Horizon 2020 heeft het European Language Grid (ELG) een centraal loket van gespecialiseerde LT-oplossingen opgezet. Inspanningen op het gebied van verspreiding en gemeenschapsopbouw hebben bijgedragen tot het bevorderen van een gemeenschappelijk begrip van de noodzaak om publieke en private krachten te bundelen en te profiteren van het beste van beide werelden op het gebied van onderzoek en inzet.
Het Horizon Europa-programma bevordert onderzoek en innovatie door steun te verlenen aan de ontwikkeling van geavanceerde LT die verder gaat dan de huidige stand van de techniek, met inbegrip van grote taalmodellen. Deze modellen, ontworpen om de interactie tussen mens en machine te verbeteren, zullen meertalige mogelijkheden hebben, meerdere invoermodi verwerken, vooroordelen beheren en contextbewustzijn vertonen.
In het kader van het initiatief voor Europese taalgelijkheid (ELE), een door het Europees Parlement geïnitieerd proefproject/voorbereidende actie, zijn een agenda en een routekaart ontwikkeld om tegen 2030 volledige gelijkheid van digitale talen in Europa tot stand te brengen.
Tot slot erkent de Commissie de waarde van taalgegevens als basis voor de opleiding van taalmodellen via de gemeenschappelijke Europese ruimte voor taalgegevens (LDS). Het project, dat wordt gefinancierd in het kader van het DIGITALE werkprogramma 2021-2022, is gericht op de uitrol van een platform en een marktplaats voor het verzamelen, delen en hergebruiken van meertalige en multimodale taalgegevens. In overeenstemming met de Europese datastrategie en het concept van dataruimten zal het ervoor zorgen dat er meer taalgegevens beschikbaar komen voor gebruik in de economie, de samenleving en het onderzoek, terwijl de bedrijven en personen die de gegevens genereren de controle behouden.
Het samenbrengen van al deze elementen, projecten en actoren is een grote uitdaging voor de Unie, de Europese industrie en de nationale overheidsdiensten. Het uiteindelijke doel is het ondersteunen van het digitale decennium van Europa ten behoeve van iedereen.
Laatste nieuws

De Commissie is ingenomen met de oprichting van het consortium voor een Europese digitale infrastructuur van de Alliantie voor taaltechnologieën (ALT-EDIC) en de taaldataruimte (LDS).

The Commission has selected a consortium that will develop ‘Simpl' – a secure middleware platform that will support data access and interoperability among European data spaces, unleashing the power of data-driven innovation.

De Commissie heeft een consortium geselecteerd dat “Simpl” zal ontwikkelen – een beveiligd middlewareplatform dat de toegang tot en interoperabiliteit van gegevens tussen Europese dataruimten zal ondersteunen en de kracht van datagestuurde innovatie zal ontketenen.

De Commissie heeft een aanbeveling aangenomen over kritieke technologiegebieden voor de economische veiligheid van de EU, met het oog op verdere risicobeoordeling met de lidstaten.
Gerelateerde inhoud
Grote afbeelding
Zoek verder
-

The EU supports research, innovation and deployment of language technologies to break down language...
Taaltechnologieën en meertaligheid

Digitale inclusie is een EU-brede inspanning om ervoor te zorgen dat iedereen kan bijdragen aan en...

Data is overal en groeit in een ongekend tempo. Om de voordelen van gegevens ten volle te benutten...