EasyxLab
Език: BG Български

Превод с ИИ на английския оригинал, който е референтната версия. Прочетете на английски

Изследвания / S4

Многоезично качество на наименованията на лекарства в Wikidata

Колко точни са многоезичните наименования на лекарства в Wikidata?

Работен вариантПубликувано 2026-10-02 · Актуализирано 2026-10-03

Резюме

Wikidata е граф на знанието под лиценз CC0, чиито многоезични етикети се използват повторно от инфокутиите в Уикипедия, услуги за превод на идентификатори и многоезично търсене на термини. Замразихме етикетите на всички 3 768 обекта в Wikidata, които имат код ATC (P267), на 20 езика (34 207 етикета), плюс 10 823 обекта с кодове по ICD-10/ICD-11. Седем детектора, базирани на правила, маркират етикети в грешна писменост, търговски наименования, несъответствия сол/изходно вещество, споделени етикети, отклонения от международните непатентни наименования (INN) на СЗО, неправилно форматирани кодове по ICD и остарели кодове ATC. Стратифицирана случайна извадка от 118 сигнала беше прегледана един по един от агента на изследването – агент, базиран на LLM (вж. paper.md §3.1).

Сигналите за писменост (0,71 за лекарства, 0,93 за заболявания), търговско наименование (0,83), споделен етикет (1,00), формат на ICD-10 (13/13) и остарял ATC (5/5) бяха предимно верни. Сигналите за INN (0,19), сол/изходно вещество (0,26) и дублиран ATC (0/4) не бяха, а за ICD-11 резултатът е неопределен (1/2).

Около 0,9% от етикетите на лекарства са грешни (≈312 от 34 207; 0,5% при долните граници на 95% ДИ за прецизността). Това е долна граница по отношение на пълнотата (recall). Грешките са съсредоточени в урду (39 на 1 000 етикета), персийски (35), руски (28) и хинди (25), срещу 2–4 на 1 000 в основните езици с латинска писменост (без английския). Сред тях са:

  • търговски наименования (Seroquel, Lyrica, Arcoxia);
  • английски текст и правописни грешки;
  • несвързано лично име: fa „mohamad“ при белимумаб;
  • етикети, които назовават друго вещество („pregabalin“ при флумехин, „omeprazole“ при езомепразол).

В ICD-10 (P494) 2,5% от стойностите са невалидни, без да се броят диапазоните; 44 показват едно и също повреждане с повторен код („B2424.“ за ХИВ/СПИН, „I10-I1515.“ за хипертония). В ATC 3,3% от изявленията са кодове, които са заменени (списък с промени на СЗО), но все още са с нормален ранг.

Шест от седемте грешки от нашия по-ранен преглед (проучвателна проверка на 59 лекарства за хронично лечение и 34 хронични заболявания) все още бяха налице; седмата беше поправена само частично.

Предлагаме 135 корекции, прегледани една по една от агента на изследването, като предложение за QuickStatements (corrections.qs). Предложението не е приложено: първо проверете отново всеки lastrevid и обсъдете промените в WikiProject Medicine. Не сме редактирали Wikidata.

Цитирайте това изследване

Цитиране
EasyxLab (2026). Multilingual quality of drug names in Wikidata. Study S4. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels
BibTeX
@techreport{easyxlab_s4,
  title       = {Multilingual quality of drug names in Wikidata},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S4},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels}
}