Zum Inhalt springen

Jaccard-Koeffizient

aus Wikipedia, der freien Enzyklopädie

Der Jaccard-Koeffizient oder Jaccard-Index, auch Intersection over Union nach dem Schweizer Botaniker Paul Jaccard (1868–1944) ist eine Kennzahl für die Ähnlichkeit von Mengen.[1] Oft wird er auch nach seiner Definition als IoU (Intersection over Union) bezeichnet.[2]

Schnittmenge (oben) und Vereinigungsmenge (unten) von zwei Mengen A und B

Jaccard entwickelte den „Jaccard-Koeffizienten“ in seiner 1902 erschienenen Schrift Lois de distribution florale dans la zone alpine auf Seite 72. Er nannte ihn „coefficient de communauté florale“.[3][4]

Der Jaccard-Koeffizient konnte sich in der Mathematik etablieren und wird als Ähnlichkeitsmaß für Mengen, Vektoren und ganz allgemein für Objekte genutzt.[5][6] Speziell wird der Jaccard-Koeffizient für automatische Texterkennung und Interpretation eingesetzt.[7]

Um den Jaccard-Koeffizient zweier Mengen zu berechnen, teilt man die Anzahl der gemeinsamen Elemente (Schnittmenge) durch die Größe der Vereinigungsmenge:

.

Für Mengen gilt

.

Je näher der Jaccard-Koeffizient an 1 liegt, desto größer ist die Ähnlichkeit der Mengen. Der minimale Wert des Jaccard-Koeffizienten ist 0.

Die beiden Mengen und haben den Jaccard-Koeffizienten

Aus dem Jaccard-Koeffizienten lässt sich die Jaccard-Metrik (auch „Jaccard-Distanz“ genannt) ableiten. Diese ist ein Maß für die Unähnlichkeit. Diese Metrik berechnet sich nach der Formel

.

Allgemein:

.

Je näher die Jaccard-Metrik an 0 liegt, desto näher liegen die Mengen A und B beieinander, weil sie sich sehr ähnlich sind. Der maximale Wert der Jaccard-Metrik ist 1. Dann sind die Mengen überschneidungsfrei.

Im Bereich Textmining und hier insbesondere der Duplikaterkennung ist die Jaccard-Ähnlichkeit ein bekanntes Maß für die Ähnlichkeit zweier Elemente. Dabei werden zwei Strings in Token zerlegt (z. B. geteilt an den Leerzeichen oder unter Verwendung von N-Grammen mit ). Die daraus entstehenden Mengen an Stringabschnitten werden wie oben beschrieben zur Berechnung der Ähnlichkeit der beiden Mengen verwendet.[8]

Einzelnachweise

[Bearbeiten | Quelltext bearbeiten]
  1. ↑ Jaccard, Paul. Abgerufen am 1. Juni 2026.
  2. ↑ Hamid Rezatofighi, Nathan Tsoi, JunYoung Gwak, Amir Sadeghian, Ian Reid, Silvio Savarese: Generalized Intersection over Union: A Metric and A Loss for Bounding Box Regression. 25. Februar 2019, abgerufen am 1. Juni 2026 (englisch).
  3. ↑ Paul Jaccard: Lois de distribution florale dans la zone alpine, Bulletin de la Société Vaudoise des Sciences Naturelles, Band 38 (1902), S. 72, doi:10.5169/seals-266762#110 Abgerufen am 23. November 2018.
  4. ↑ Huihuan Qian: Intelligent surveillance systems. Springer, Dordrecht 2011, ISBN 978-94-007-1137-2.
  5. ↑ Ähnlichkeitsmaße für Vektoren (Memento des Originals vom 23. November 2018 im Internet Archive)  Info: Der Archivlink wurde automatisch eingesetzt und noch nicht geprüft. Bitte prüfe Original- und Archivlink gemäß Anleitung und entferne dann diesen Hinweis. bei Fraunhofer. Abgerufen am 23. November 2018.
  6. ↑ Jaccard-Koeffizient in Hans Friedrich Eckey, Reinhold Kosfeld, Martina Rengers: Multivariate Statistik, Betriebswirtschaftlicher Verlag Dr. Th. Gabler GmbH, Wiesbaden, 2002, ISBN 3-409-11969-8, S. 219. Abgerufen am 23. November 2018.
  7. ↑ Jaccard-Koeffizient bei seo-suedwes. Abgerufen am 23. November 2018.
  8. ↑ Bing Liu: Web Data Mining: Exploring Hyperlinks, Contents, and Usage Data. 2. Auflage. Springer-Verlag, Berlin / Heidelberg 2011, ISBN 978-3-642-19459-7, S. 231 f.