EasyxLab
Język: PL Polski

Tłumaczenie wykonane przez AI z angielskiego oryginału, który jest wersją referencyjną. Czytaj po angielsku

Badania / S4

Wielojęzyczna jakość nazw leków w Wikidata

Jak dokładne są wielojęzyczne nazwy leków w Wikidata?

Wersja roboczaOpublikowano 2026-10-02 · Zaktualizowano 2026-10-03

Streszczenie

Wikidata to graf wiedzy na licencji CC0, którego wielojęzyczne etykiety są ponownie wykorzystywane w infoboksach Wikipedii, usługach tłumaczenia identyfikatorów i wielojęzycznym wyszukiwaniu terminów. Zamroziliśmy etykiety wszystkich 3 768 elementów Wikidata z kodem ATC (P267) w 20 językach (34 207 etykiet) oraz 10 823 elementów z kodami ICD-10/ICD-11. Siedem detektorów opartych na regułach oznacza etykiety w niewłaściwym piśmie, nazwy handlowe, niezgodności sól/substancja macierzysta, etykiety współdzielone, odstępstwa od międzynarodowych nazw niezastrzeżonych WHO (INN), błędnie sformatowane kody ICD i przestarzałe kody ATC. Warstwową próbę losową 118 oznaczeń przejrzał jedno po drugim agent badania, czyli agent oparty na LLM (zob. paper.md §3.1).

Oznaczenia dotyczące pisma (0,71 dla leków, 0,93 dla chorób), nazw handlowych (0,83), etykiet współdzielonych (1,00), formatu ICD-10 (13/13) i przestarzałych kodów ATC (5/5) były w większości trafne. Oznaczenia INN (0,19), sól/substancja macierzysta (0,26) i zduplikowanych kodów ATC (0/4) nie były trafne, a dla ICD-11 wynik jest nierozstrzygnięty (1/2).

Około 0,9% etykiet leków jest błędnych (≈312 z 34 207; 0,5% przy dolnych granicach 95% CI dla precyzji). Jest to dolna granica w odniesieniu do pełności (recall). Błędy koncentrują się w języku urdu (39 na 1 000 etykiet), perskim (35), rosyjskim (28) i hindi (25), wobec 2–4 na 1 000 w głównych językach zapisywanych alfabetem łacińskim (z wyłączeniem angielskiego). Należą do nich:

  • nazwy handlowe (Seroquel, Lyrica, Arcoxia);
  • tekst w języku angielskim i literówki;
  • niezwiązane imię osoby: fa „mohamad” przy belimumabie;
  • etykiety wskazujące inną substancję („pregabalin” przy flumechinie, „omeprazole” przy ezomeprazolu).

W ICD-10 (P494) 2,5% wartości jest nieprawidłowych, z wyłączeniem zakresów; 44 wykazują to samo uszkodzenie polegające na powtórzeniu kodu („B2424.” dla HIV/AIDS, „I10-I1515.” dla nadciśnienia). W ATC 3,3% deklaracji to kody zastąpione (lista zmian WHO), które nadal mają rangę zwykłą.

Sześć z siedmiu błędów z naszego wcześniejszego przeglądu (eksploracyjnej kontroli 59 leków stosowanych w leczeniu przewlekłym i 34 chorób przewlekłych) nadal występowało; siódmy został poprawiony tylko częściowo.

Proponujemy 135 poprawek, przejrzanych jedna po drugiej przez agenta badania, w formie propozycji QuickStatements (corrections.qs). Propozycja nie została zastosowana: najpierw należy ponownie sprawdzić każdy lastrevid i przedyskutować zmiany w WikiProject Medicine. Nie edytowaliśmy Wikidata.

Jak cytować to badanie

Cytowanie
EasyxLab (2026). Multilingual quality of drug names in Wikidata. Study S4. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels
BibTeX
@techreport{easyxlab_s4,
  title       = {Multilingual quality of drug names in Wikidata},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S4},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels}
}