Digitekstide uurimiskeskus
Digitekstide uurimiskeskus (DigiTS) on tekstianalüüsile keskenduv projekt, mida rahastab Euroopa Liit. Projekti raames moodustatakse uus interdistsiplinaarne uurimistiim, mis võimaldab mitmeid olulisi tegevusi. Esiteks võimaldab DigiTS keskenduda uutele teadustegevusele, sealhulgas eesti keelele suunatud suurte keelemudelite (LLMide) arendamisele ja edendamisele. Teiseks võimaldab DigiTS laiendada digihumanitaaria õpetamist kõigil kõrghariduse tasemetel. Kolmandaks loob DigiTS tugeva aluse koostööks teiste Tartu Ülikooli üksustega, GLAM-asutustega (galeriid, raamatukogud, arhiivid, muuseumid) ning valdkonna idufirmadega. Kuna tekstipõhine digihumanitaaria on seotud mitmete humanitaar- ja sotsiaalteaduste valdkondadega, suurendab DigiTS võimekust rakendada digimeetodeid tekstipõhiste andmete töötlemisel mitmetes teadusvaldkondades. Rohkem infot: www.digits.ut.ee. Kontakt digihumanitaaria keskuses: [email protected].
EKTB100 "Eesti keele süntaktilise analüüsi ressursid"
Projekti eesmärgiks on arendada eesti keele süntaktilise analüüsi ressursse ning selle kaudu eesti keele automaatset süntaktilist analüüsi.
Vajadus test- ja treeningandmestike järgi ei kao ka suurte keelemudelite domineerimise ajastul.
Põhiline keeleressurss, millega töötatakse, on eesti keele Universal Dependencies' puudepangad ehk sõltuvussüntaktiliselt märgendatud korpused. Keeleressursse luuakse ja arendatakse kooskõlas Universal Dependencies, UNIDIVE jt rahvusvaheliste standarditega.
Kõik loodavad ressursid on vabalt kasutatavad CC-BY litsentsiga. Projekti käigus loodud avalike ja standardiseeritud keeleressursside peal saavad asjasthuvitatud luua endale sobiva konfiguratsiooniga mudeleid. Kontakt digihumanitaaria keskuses: [email protected].
EKKD-TA10 "Infoeraldus ajalooliste institutsioonide protokollide (1880–1940) näitel".
Eesti 19. sajandi vallakohtuprotokollid on olnud asendamatuks allikaks talupojaühiskonnas toimunud protsesside ja tollase keelekasutuse uurimisel. 2019. a käivitatud ühisloomeprojekti toel on tänaseks sisestatud u 127300 protokolli. Loodud ressurss on pälvinud laia avalikku tähelepanu, avanud ajaloolastele ja keeleteadlastele võimalusi ainese mitmekülgseks uurimiseks ning suunanud uutele väljakutsetele. Käesoleva projekti eesmärgiks on analüüsida võrdlevalt kolme andmekogu ajavahemikust 1880-1940, et edasi arendada vanema keelekasutuse töötlemist ja kiirendada hajusa teabe leitavust, mis laiendab isiku, koha ja temaatiliste päringute tegemist mäluasutustes. Projekt annab töövahendid, mida saab kohandada ka teistele ajaloolistele tekstidele automaattöötluseks infoeraldamise eesmärgil. Normaliseeritavad tekstid saavad olema suurepäraseks allikaks keelelise varieerumise uurimisel. Andmete ristkasutus laiendab ajalooliste, keeleliste ja kultuuriliste protsesside analüüsi ning mõtestamist. Vastutav täitja: Aigi Rahi-Tamm. Kontakt digihumanitaaria keskuses: [email protected].
COST-action UniDive
Projektis tegeletakse interdistsiplinaarselt keeleliste universaalide, keelelise mitmekesisuse ja keelelise ebareeglipärasusega keeletehnoloogia vaatenurgast. Rohkem infot: https://unidive.lisn.upsaclay.fr/. Kontakt digihumanitaaria keskuses: [email protected].