EasyxLab
Sprache: DE Deutsch

KI-Übersetzung des englischen Originals, das die maßgebliche Fassung ist. Auf Englisch lesen

Studien / S6

Tragen KI-generierte Bilder auf Wikimedia Commons Herkunftskennzeichnungen?

ArbeitsentwurfVeröffentlicht 2026-10-03

Zusammenfassung

Wikimedia Commons speichert hochgeladene Dateien Byte für Byte. Daher zeigt es, welche KI-Herkunftskennzeichnungen ein öffentliches Archiv erreichen, wenn der Host sie nicht entfernt. Wir haben jede Datei erfasst, die Commons als KI-generiert kennzeichnet: den Kategorienbaum Category:AI-generated images (530 Kategorien) und {{PD-algorithm}}, insgesamt 8.971 Dateien. Anschließend haben wir 2.084 Originale aus einer nach Monaten geschichteten Stichprobe mit ai-mark-lint untersucht; jede Datei wurde heruntergeladen, geprüft und gelöscht.

Wir berichten über zwei Populationen. Die Hauptpopulation besteht aus dem Kategorienbaum und den {{PD-algorithm}}-Dateien, deren Kategorien Hinweise auf KI enthalten (1.585 gemessene Dateien); einige dieser Bilder sind mit KI verändert und nicht mit KI erzeugt. Die Vereinigungsmenge umfasst zusätzlich die übrigen {{PD-algorithm}}-Dateien (2.084 gemessen).

Kennzeichnungen in der Hauptpopulation. Der Anteil der Dateien mit einer maschinenlesbaren KI-Kennzeichnung stieg im Juni 2026 stark an: von 25,8 % der Uploads von Januar–Mai (n = 532) auf 50,2 % der Uploads von Juni–Juli (n = 313). Das sind +24,4 Prozentpunkte; ein Bootstrap mit Resampling der Upload-Tage ergibt +14,7 bis +33,6. August–September (n = 461) zeigt 43,4 %, oder 53,3 % ohne einen großen ungekennzeichneten Stapel von Wappen.

Vor und nach dem 2. August. Der Vergleich von Januar–Juli mit August–September, als Art. 50(2) der Verordnung über künstliche Intelligenz der EU anwendbar wurde, ergibt +8,4 Prozentpunkte (Bootstrap mit Tages-Clustern +0,2 bis +17). Er hängt von diesem Stapel ab: ohne ihn beträgt die Differenz +17,8 Prozentpunkte. Keiner der beiden Vergleiche lässt sich der Verordnung über künstliche Intelligenz zuschreiben.

Arten von Kennzeichnungen. Fast jede Kennzeichnung ist ein C2PA-Manifest, überwiegend von OpenAI und Google. Der IPTC-DigitalSourceType allein kennzeichnet 1,5 % der Dateien der Hauptpopulation. Eine lesbare chinesische AIGC-Kennzeichnung findet sich bei 1 Datei der Vereinigungsmenge, und 3 weitere Dateien tragen eine doppelt kodierte Kennzeichnung.

Validierung. Wir haben einen Fehler in unserem eigenen Validator gefunden: ai-mark-lint 0.1.0 lehnte 302 der 625 lesbaren Manifeste (Vereinigungsmenge) ab, 187 davon, weil keine Liste für die erweiterte Schlüsselverwendung (Extended Key Usage) konfiguriert war. Der Fehler ist in 0.1.1 behoben. Mit der korrigierten Regel scheitern 117 Manifeste (18,7 %), aus folgenden Gründen:

  • abgelaufene Zertifikate in Manifesten ohne Zeitstempel (85);
  • nach dem Signieren geänderter Inhalt (32);
  • Verstöße gegen die C2PA-Regel zur ersten Aktion (26);
  • Manifeste von Microsoft Paint (12).

Mit der offiziellen C2PA Trust List sind 452 von 624 Manifesten (72 %) gültig und vertrauenswürdig.

Diese Studie zitieren

Zitation
EasyxLab (2026). Do AI-generated images on Wikimedia Commons carry provenance marks? Study S6. EasyByte Hub S. Coop. Mad. https://github.com/easybytehub/easyxlab/tree/main/studies/s6-commons-ai-marks
BibTeX
@techreport{easyxlab_s6,
  title       = {Do AI-generated images on Wikimedia Commons carry provenance marks?},
  author      = {{EasyxLab}},
  institution = {EasyByte Hub S. Coop. Mad.},
  number      = {S6},
  year        = {2026},
  url         = {https://github.com/easybytehub/easyxlab/tree/main/studies/s6-commons-ai-marks}
}