Cheat Sheet

Erste Schritte mit der Text Analytics Toolbox

Der Prozess des semantischen Text-Minings zur Extraktion latenter Informationen aus verschiedenen Dokumenttypen

Text Analytics Toolbox™ umfasst Algorithmen und Visualisierungen zur Vorverarbeitung, Analyse und Modellierung von Textdaten. Mit der Toolbox erstellte Modelle können in Anwendungen wie Sentiment-Analyse, Predictive Maintenance und Themenmodellierung verwendet werden.

Funktionsname Beschreibung
wordcloud Erstellen eines Wortwolken-Diagramms aus einem Bag-of-Words- oder LDA-Modell
wordCloudCounts Wortzählung für die Erstellung einer Wortwolke
textscatter 2D-Steudiagramm für Text
textscatter3 3D-Steudiagramm für Text
heatmap Erstellen eines Heatmap-Diagramms
histcounts Histogramm-Klassenhäufigkeiten
discretize Gruppieren von Daten in Bins oder Kategorien
Wortwolke

Visualisieren

Verwenden Sie Wortwolken und Text-Streudiagramme, um Ergebnisse zusammenzufassen und zu validieren.

Nicht überwachtes Lernen

Modellierung und Vorhersage

Wandeln Sie Text mithilfe von Bag-of-Words- oder vortrainierten Word-Embedding-Modellen in numerische Darstellungen um und wenden Sie spezielle Machine-Learning-Algorithmen für Vorhersagen und Themenmodellierung an.

Funktionsname Beschreibung
readWordEmbedding Einlesen von Word-Embedding aus Textdatei
trainWordEmbedding Trainieren von Word-Embedding
word2vec/vec2word Zuordnen von Wörtern zu Embedding-Vektoren
ldaModel Latent-Dirichlet-Allocation (LDA)-Modell
lsaModel Latent-Semantic-Analysis (LSA)-Modell
bagOfWords Bag-of-Words-Modell
fitlda Anpassen eines Latent-Dirichlet-Allocation (LDA)-Modells
fitlsa Anpassen eines Latent-Semantic-Analysis (LSA)-Modells
predict Vorhersage der wichtigsten LDA-Themen von Dokumenten
fitdist Anpassen eines Wahrscheinlichkeitsverteilungsobjekts an Daten
fitrlinear Anpassen eines linearen Regressionsmodells an hochdimensionale Daten
fitclinear Anpassen eines linearen Klassifizierungsmodells an hochdimensionale Daten
fitcecoc Anpassen von Multiklassenmodellen für Klassifikatoren
Funktionsname Beschreibung
extractFileText Lesen aus PDF-, Microsoft Word- und Klartext-Dateien
textscan Lesen von formatierten Daten aus einer Textdatei oder einer Zeichenfolge
readtable Tabelle aus einer Datei erstellen
compose Umwandeln von Daten in ein formatiertes Zeichenfolgen-Array
xlsread Lesen von Microsoft Excel-Tabellenkalkulationsdatei
webread Lesen von Inhalt aus RESTful-Webservice
TabularTextDatastore Datastore für tabellarische Textdateien
FileDatastore Datastore mit benutzerdefiniertem Dateileser
SpreadsheetDatastore Datastore für Tabellenkalkulationsdateien
Symbole für PDF-, Text- und Tabellenkalulationsdateien

Import

Extrahieren von Text aus Microsoft® Word®-Dateien, PDF-Dateien, Textdateien und Tabellenkalkulationen.

Textvorverarbeitung

Vorverarbeitung

Entfernen von weniger hilfreichen Artefakten wie häufig vorkommende Wörter, Satzzeichen und URLs und Anwendung von Textnormalisierung, um Wörter auf ihren Wortstamm zurückzuführen.

Funktionsname Beschreibung
tokenizedDocument Aufteilen von Dokumenten in Wortsammlungen
normalizeWords Entfernen von Wortendungen mithilfe von Porter-Stemmer
bagOfWords Bag-of-Words-Modell
stopWords Liste mit Stoppwörtern
context Durchsuchen von Dokumenten nach Wortvorkommen im Kontext
removeWords Entfernen ausgewählter Wörter aus Dokument oder Bag-of-Words
removeLongWords Entfernen langer Wörter aus Dokumenten oder Bag-of-Words
removeShortWords Entfernen kurzer Wörter aus Dokumenten oder Bag-of-Words
removeInfrequentWords Entfernen von selten vorkommenden Wörtern aus einem Bag-of-Words-Modell
erasePunctuation Löschen von Satzzeichen aus Text und Dokumenten
Funktionsname Beschreibung
str = "Hello, world" Deklarieren einer Zeichenfolgen-Variablen
str = ["Hello","World"] Deklarieren eines Zeichenfolgen-Arrays
str = string(C) Umwandeln eines Zeichenvektors C in eine Zeichenfolge
str2double Umwandeln einer Zeichenfolge in Double-Zahlen
strlength Rückgeben der Länge von Zeichenfolgen
isstring Bestimmen, ob der Input ein Zeichenfolgen-Array ist
join Kombinieren von Zeichenfolgen
split Aufteilen von Zeichenfolgen in einem Zeichenfolgen-Array
splitlines Aufteilen einer Zeichenfolge an Zeilenumbruchzeichen
replace Finden und Ersetzen von Teilzeichenfolgen in einem Zeichenfolgen-Array
contains Bestimmen, ob ein Muster in einer Zeichenfolge enthalten ist
erase Löschen von Teilzeichenfolgen innerhalb von Zeichenfolgen
extractBetween Extrahieren von Teilzeichenfolgen zwischen Indikatoren
extractAfter Extrahieren von Teilzeichenfolgen nach der angegebenen Position
extractBefore Extrahieren von Teilzeichenfolgen vor der angegebenen Position
strcmp Vergleichen von Zeichenfolgen
regexp Regulären Ausdruck abgleichen (Groß-/Kleinschreibung beachten)
"Hello,world"

String

Effizientes Bearbeiten, Vergleichen und Speichern von Textdaten.