Azterlanak / S4
Sendagaien izenen kalitate eleaniztuna Wikidatan
Zenbateraino dira zehatzak Wikidatako sendagai-izen eleaniztunak?
Laburpena
Wikidata CC0 lizentziako ezagutza-grafo bat da, eta haren etiketa eleaniztunak Wikipediako infoboxetan, identifikatzaileak itzultzeko zerbitzuetan eta termino-bilaketa eleaniztunean berrerabiltzen dira. ATC kodea (P267) duten Wikidatako 3.768 elementu guztien etiketak izoztu genituen 20 hizkuntzatan (34.207 etiketa), bai eta ICD-10/ICD-11 kodeak dituzten 10.823 elementurenak ere. Arauetan oinarritutako zazpi detektorek seinalatzen dituzte idazkera okerreko etiketak, marka-izenak, gatz/oinarrizko substantzia desadostasunak, partekatutako etiketak, OMEren nazioarteko izendapen komunetatik (INN) desbideratzeak, formatu okerreko ICD kodeak eta zaharkitutako ATC kodeak. 118 seinaleren lagin aleatorio geruzatu bat banan-banan berrikusi zuen azterlaneko agenteak, LLMetan oinarritutako agente batek (ikus paper.md §3.1).
Idazkeraren (0,71 sendagaietan, 0,93 gaixotasunetan), marka-izenaren (0,83), etiketa partekatuaren (1,00), ICD-10 formatuaren (13/13) eta ATC zaharkituaren (5/5) seinaleak zuzenak izan ziren gehienetan. INN (0,19), gatz/oinarrizko substantzia (0,26) eta ATC bikoiztuaren (0/4) seinaleak ez, eta ICD-11 zehaztu gabe dago (1/2).
Sendagai-etiketen %0,9 inguru okerrak dira (≈312, 34.207tik; %0,5 zehaztasunaren (precision) %95eko konfiantza-tartearen beheko mugetan). Beheko muga bat da hori, estaldurari (recall) dagokionez. Akatsak urduz (1.000 etiketako 39), persieraz (35), errusieraz (28) eta hindiz (25) pilatzen dira; alfabeto latinoko hizkuntza nagusietan, berriz, 2–4 dira 1.000ko (ingelesa kanpo utzita). Hauek daude haien artean:
- marka-izenak (Seroquel, Lyrica, Arcoxia);
- ingelesezko testua eta ortografia-akatsak;
- zerikusirik ez duen pertsona-izen bat: fa «mohamad» belimumabean;
- beste substantzia bat izendatzen duten etiketak («pregabalin» flumekinan, «omeprazole» esomeprazolean).
ICD-10 sailkapenean (P494), balioen %2,5 baliogabeak dira, tarteak kanpo utzita; 44k kode errepikatuaren hondatze bera erakusten dute («B2424.» GIB/HIESerako, «I10-I1515.» hipertentsiorako). ATC sailkapenean, adierazpenen %3,3 ordeztutako kodeak dira (OMEren aldaketa-zerrenda), baina oraindik ere normal maila dute.
Gure aurreko berrikuspeneko zazpi akatsetatik sei oraindik bazeuden (tratamendu kronikoko 59 sendagairen eta 34 gaixotasun kronikoren azterketa esploratzaile bat); zazpigarrena partzialki baino ez zen konpondu.
135 zuzenketa proposatzen ditugu, azterlaneko agenteak banan-banan berrikusiak, QuickStatements proposamen gisa (corrections.qs). Proposamena ez da aplikatu: egiaztatu berriro lastrevid bakoitza eta eztabaidatu lehenik WikiProject Medicine proiektuan. Ez dugu Wikidata editatu.
Aipatu azterlan hau
EasyxLab (2026). Multilingual quality of drug names in Wikidata. Study S4. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels@techreport{easyxlab_s4,
title = {Multilingual quality of drug names in Wikidata},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S4},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels}
}