EasyxLab
Γλώσσα: EL Ελληνικά

Μετάφραση με τεχνητή νοημοσύνη του αγγλικού πρωτοτύπου, το οποίο είναι η έκδοση αναφοράς. Ανάγνωση στα αγγλικά

Μελέτες / S4

Πολύγλωσση ποιότητα των ονομάτων φαρμάκων στο Wikidata

Πόσο ακριβή είναι τα πολύγλωσσα ονόματα φαρμάκων του Wikidata;

Προσχέδιο εργασίαςΔημοσίευση 2026-10-02 · Ενημέρωση 2026-10-03

Περίληψη

Το Wikidata είναι ένας γράφος γνώσης με άδεια CC0, του οποίου οι πολύγλωσσες ετικέτες επαναχρησιμοποιούνται από πλαίσια πληροφοριών (infoboxes) της Wikipedia, υπηρεσίες μετάφρασης αναγνωριστικών και πολύγλωσση αναζήτηση όρων. «Παγώσαμε» τις ετικέτες όλων των 3.768 στοιχείων του Wikidata που φέρουν κωδικό ATC (P267) σε 20 γλώσσες (34.207 ετικέτες), καθώς και 10.823 στοιχείων με κωδικούς ICD-10/ICD-11. Επτά ανιχνευτές βασισμένοι σε κανόνες επισημαίνουν ετικέτες σε λάθος σύστημα γραφής, εμπορικές ονομασίες, αναντιστοιχίες άλατος/μητρικής ουσίας, κοινές ετικέτες, αποκλίσεις από τις διεθνείς κοινόχρηστες ονομασίες (INN) του ΠΟΥ, κακοσχηματισμένους κωδικούς ICD και παρωχημένους κωδικούς ATC. Ένα στρωματοποιημένο τυχαίο δείγμα 118 επισημάνσεων εξετάστηκε μία προς μία από τον πράκτορα της μελέτης, έναν πράκτορα βασισμένο σε LLM (βλ. paper.md §3.1).

Οι επισημάνσεις συστήματος γραφής (0,71 για φάρμακα, 0,93 για νόσους), εμπορικής ονομασίας (0,83), κοινής ετικέτας (1,00), μορφής ICD-10 (13/13) και παρωχημένου ATC (5/5) ήταν ως επί το πλείστον σωστές. Οι επισημάνσεις INN (0,19), άλατος/μητρικής ουσίας (0,26) και διπλότυπου ATC (0/4) δεν ήταν, ενώ για το ICD-11 το αποτέλεσμα είναι ακαθόριστο (1/2).

Περίπου το 0,9% των ετικετών φαρμάκων είναι λανθασμένο (≈312 από 34.207· 0,5% στα κατώτερα όρια των 95% ΔΕ της ακρίβειας (precision)). Πρόκειται για κατώτερο όριο ως προς την ανάκληση (recall). Τα σφάλματα συγκεντρώνονται στα ουρντού (39 ανά 1.000 ετικέτες), τα περσικά (35), τα ρωσικά (28) και τα χίντι (25), έναντι 2–4 ανά 1.000 στις μεγάλες γλώσσες με λατινικό αλφάβητο (εξαιρουμένων των αγγλικών). Περιλαμβάνουν:

  • εμπορικές ονομασίες (Seroquel, Lyrica, Arcoxia)·
  • αγγλικό κείμενο και ορθογραφικά λάθη·
  • ένα άσχετο όνομα προσώπου: fa «mohamad» στην μπελιμουμάμπη·
  • ετικέτες που ονομάζουν διαφορετική ουσία («pregabalin» στη φλουμεκίνη, «omeprazole» στην εσομεπραζόλη).

Στο ICD-10 (P494), το 2,5% των τιμών είναι άκυρο, εξαιρουμένων των εύρων· 44 εμφανίζουν την ίδια αλλοίωση με επαναλαμβανόμενο κωδικό («B2424.» για HIV/AIDS, «I10-I1515.» για την υπέρταση). Στο ATC, το 3,3% των δηλώσεων είναι κωδικοί που έχουν αντικατασταθεί (κατάλογος αλλαγών του ΠΟΥ) αλλά εξακολουθούν να έχουν κατάταξη normal.

Έξι από τα επτά σφάλματα της προηγούμενης αξιολόγησής μας (ένας διερευνητικός έλεγχος 59 φαρμάκων χρόνιας θεραπείας και 34 χρόνιων νόσων) υπήρχαν ακόμη· το έβδομο είχε διορθωθεί μόνο εν μέρει.

Προτείνουμε 135 διορθώσεις, εξετασμένες μία προς μία από τον πράκτορα της μελέτης, ως πρόταση QuickStatements (corrections.qs). Η πρόταση δεν έχει εφαρμοστεί: ελέγξτε ξανά κάθε lastrevid και συζητήστε πρώτα στο WikiProject Medicine. Δεν έχουμε επεξεργαστεί το Wikidata.

Παραπομπή σε αυτή τη μελέτη

Παραπομπή
EasyxLab (2026). Multilingual quality of drug names in Wikidata. Study S4. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels
BibTeX
@techreport{easyxlab_s4,
  title       = {Multilingual quality of drug names in Wikidata},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S4},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s4-wikidata-drug-labels}
}