Études / S4
Qualité multilingue des noms de médicaments dans Wikidata
Quelle est l'exactitude des noms multilingues de médicaments dans Wikidata ?
Résumé
Wikidata est un graphe de connaissances sous CC0 dont les libellés multilingues sont réutilisés par les infobox de Wikipédia, par des services de traduction d'identifiants et par la recherche multilingue de termes. Nous avons figé les libellés de l'ensemble des 3 768 éléments de Wikidata qui portent un code ATC (P267) dans 20 langues (34 207 libellés), ainsi que 10 823 éléments dotés de codes CIM-10/CIM-11. Sept détecteurs à base de règles signalent les libellés dans une mauvaise écriture, les noms commerciaux, les incohérences sel/molécule mère, les libellés partagés, les écarts par rapport à la DCI de l'OMS, les codes CIM mal formés et les codes ATC obsolètes. Un échantillon aléatoire stratifié de 118 signalements a été examiné un par un par l'agent de l'étude, un agent fondé sur un LLM (voir paper.md §3.1).
Les signalements d'écriture (0,71 pour les médicaments, 0,93 pour les maladies), de nom commercial (0,83), de libellé partagé (1,00), de format CIM-10 (13/13) et d'ATC obsolète (5/5) étaient majoritairement corrects. Ceux de DCI (0,19), de sel/molécule mère (0,26) et d'ATC en double (0/4) ne l'étaient pas, et la CIM-11 reste indéterminée (1/2).
Environ 0,9 % des libellés de médicaments sont erronés (≈312 sur 34 207 ; 0,5 % aux bornes inférieures de l'IC à 95 % de la précision). Il s'agit d'une borne inférieure au regard du rappel. Les erreurs se concentrent en ourdou (39 pour 1 000 libellés), en persan (35), en russe (28) et en hindi (25), contre 2 à 4 pour 1 000 dans les principales langues à écriture latine (hors anglais). Elles comprennent :
- des noms commerciaux (Seroquel, Lyrica, Arcoxia) ;
- du texte en anglais et des fautes d'orthographe ;
- un nom de personne sans rapport : fa « mohamad » sur le bélimumab ;
- des libellés qui désignent une autre substance (« pregabalin » sur la fluméquine, « omeprazole » sur l'ésoméprazole).
Dans la CIM-10 (P494), 2,5 % des valeurs sont invalides, hors plages ; 44 présentent la même corruption par code répété (« B2424. » pour le VIH/sida, « I10-I1515. » pour l'hypertension). Dans l'ATC, 3,3 % des déclarations sont des codes remplacés (liste des modifications de l'OMS) mais toujours au rang normal.
Six des sept erreurs de notre examen précédent (une vérification exploratoire portant sur 59 médicaments de traitement chronique et 34 maladies chroniques) étaient toujours présentes ; la septième n'avait été que partiellement corrigée.
Nous proposons 135 corrections, examinées une par une par l'agent de l'étude, sous la forme d'une proposition QuickStatements (corrections.qs). La proposition n'a pas été appliquée : il faut d'abord revérifier chaque lastrevid et en discuter au WikiProject Medicine. Nous n'avons pas modifié Wikidata.
Citer cette étude
EasyxLab (2026). Multilingual quality of drug names in Wikidata. Study S4. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels@techreport{easyxlab_s4,
title = {Multilingual quality of drug names in Wikidata},
author = {{EasyxLab}},
institution = {EasyByte Hub S. Coop. Mad.},
number = {S4},
year = {2026},
url = {https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels}
}