Cheat Sheet

Welcher Machine-Learning-Algorithmus eignet sich für Ihr Projekt?

Daten und eine Anwendung haben Sie schon, doch welcher Algorithmus ist nun am besten geeignet? Bei der Auswahl lassen sich Kompromisse kaum vermeiden. Die folgenden Hinweise und Grundprinzipien können jedoch hilfreich sein.

Größe Ihres Datensatzes

Algorithmen arbeiten je nach Größe Ihres Datensatzes unterschiedlich gut oder schlecht. Es gibt zwar keine festen Regeln dafür, welcher Algorithmus für Datensätze kleiner als 50 MB oder größer als 1 TB genutzt werden sollte, aber je nach Datenmenge und unter der Annahme einer ausgewogenen Verteilung in Ihrer Stichprobe eignen sich manche Algorithmen besser als andere.

  • Entscheidungsbäume
  • Lineare Modelle (inkl. logistische Regression und lineare Diskriminanzanalyse (LDA)

  • (Nichtlineare) SVM
  • Naïve Bayes
  • Nächster Nachbar
  • Neuronales Netz (flach)

  • Tiefe Netze
  • Ensembles

Trainingsdauer

Die Trainingsdauer bezieht sich darauf, wie lange es dauert, das neue Modell mit gegebenen Rechenressourcen zu erstellen und zu trainieren. Die Dauer wird von verschiedenen Faktoren beeinflusst, zum Beispiel von der Architektur und Komplexität des Algorithmus. Je nachdem, wie wichtig eine kurze Trainingsdauer für Ihr Projekt ist, wenn Sie keine Hardware zur Beschleunigung haben, eigenen sich die folgenden Algorithmen.

  • Entscheidungsbäume
  • Lineare Modelle (inkl. logistische Regression und LDA)
  • Naïve Bayes

  • Ensembles
  • Nächster Nachbar
  • Neuronales Netz (flach)

  • (Nichtlineare) SVM

  • Tiefe Netze

Interpretierbarkeit

Machine-Learning-Modelle sind nicht immer leicht verständlich und nachvollziehbar. Die Interpretierbarkeit gibt an, wie transparent der Entscheidungsprozess des Algorithmus ist. Allerdings geht die Interpretierbarkeit oft auf Kosten von Leistung und Genauigkeit. Zudem kann es je nach Branche und Anwendung unterschiedliche Anforderungen an Transparenz und Interpretierbarkeit geben. Zu Ihrer ersten Orientierung sind typische Algorithmen hier danach sortiert, wie leicht oder schwer sich ihre Ausgaben interpretieren lassen.

  • Entscheidungsbäume
  • Lineare Modelle (inkl. logistische Regression und LDA)

  • Nächster Nachbar
  • Neuronales Netz (flach)
  • Naïve Bayes

  • (Nichtlineare) SVM
  • Ensembles
  • Tiefe Netze

Feinanpassung

Bei der Feinanpassung werden die Parameter oder Hyperparameter eines bestimmten Modells optimiert, um die besten Ergebnisse für Ihr Projekt zu erzielen. Manche Algorithmen lassen kaum Feinanpassungen zu und schränken die Anzahl der Parameter oder Hyperparameter ein, die Sie für Ihre Anwendung anpassen und optimieren können. Nachdem Sie eine bestimmte Art von Modell für das Training ausgewählt haben, können Sie automatisch die Parameter ändern, die sich am stärksten auf die Performance auswirken, um Ihr Modell zu optimieren. Wie viele Optionen zur Feinanpassung benötigen Sie?

  • Lineare Modelle (inkl. logistische Regression und LDA)
  • Nächster Nachbar

  • Entscheidungsbäume
  • (Nichtlineare) SVM
  • Ensembles
  • Naïve Bayes
  • Neuronales Netz (flach)

  • Tiefe Netze