Erste Schritte mit der Text Analytics Toolbox
Text Analytics Toolbox™ umfasst Algorithmen und Visualisierungen zur Vorverarbeitung, Analyse und Modellierung von Textdaten. Mit der Toolbox erstellte Modelle können in Anwendungen wie Sentiment-Analyse, Predictive Maintenance und Themenmodellierung verwendet werden.
| Funktionsname | Beschreibung |
|---|---|
wordcloud |
Erstellen eines Wortwolken-Diagramms aus einem Bag-of-Words- oder LDA-Modell |
wordCloudCounts |
Wortzählung für die Erstellung einer Wortwolke |
textscatter |
2D-Steudiagramm für Text |
textscatter3 |
3D-Steudiagramm für Text |
heatmap |
Erstellen eines Heatmap-Diagramms |
histcounts |
Histogramm-Klassenhäufigkeiten |
discretize |
Gruppieren von Daten in Bins oder Kategorien |
Visualisieren
Verwenden Sie Wortwolken und Text-Streudiagramme, um Ergebnisse zusammenzufassen und zu validieren.
| Funktionsname | Beschreibung |
|---|---|
readWordEmbedding |
Einlesen von Word-Embedding aus Textdatei |
trainWordEmbedding |
Trainieren von Word-Embedding |
word2vec/vec2word |
Zuordnen von Wörtern zu Embedding-Vektoren |
ldaModel |
Latent-Dirichlet-Allocation (LDA)-Modell |
lsaModel |
Latent-Semantic-Analysis (LSA)-Modell |
bagOfWords |
Bag-of-Words-Modell |
fitlda |
Anpassen eines Latent-Dirichlet-Allocation (LDA)-Modells |
fitlsa |
Anpassen eines Latent-Semantic-Analysis (LSA)-Modells |
predict |
Vorhersage der wichtigsten LDA-Themen von Dokumenten |
fitdist |
Anpassen eines Wahrscheinlichkeitsverteilungsobjekts an Daten |
fitrlinear |
Anpassen eines linearen Regressionsmodells an hochdimensionale Daten |
fitclinear |
Anpassen eines linearen Klassifizierungsmodells an hochdimensionale Daten |
fitcecoc |
Anpassen von Multiklassenmodellen für Klassifikatoren |
| Funktionsname | Beschreibung |
|---|---|
extractFileText |
Lesen aus PDF-, Microsoft Word- und Klartext-Dateien |
textscan |
Lesen von formatierten Daten aus einer Textdatei oder einer Zeichenfolge |
readtable |
Tabelle aus einer Datei erstellen |
compose |
Umwandeln von Daten in ein formatiertes Zeichenfolgen-Array |
xlsread |
Lesen von Microsoft Excel-Tabellenkalkulationsdatei |
webread |
Lesen von Inhalt aus RESTful-Webservice |
TabularTextDatastore |
Datastore für tabellarische Textdateien |
FileDatastore |
Datastore mit benutzerdefiniertem Dateileser |
SpreadsheetDatastore |
Datastore für Tabellenkalkulationsdateien |
| Funktionsname | Beschreibung |
|---|---|
tokenizedDocument |
Aufteilen von Dokumenten in Wortsammlungen |
normalizeWords |
Entfernen von Wortendungen mithilfe von Porter-Stemmer |
bagOfWords |
Bag-of-Words-Modell |
stopWords |
Liste mit Stoppwörtern |
context |
Durchsuchen von Dokumenten nach Wortvorkommen im Kontext |
removeWords |
Entfernen ausgewählter Wörter aus Dokument oder Bag-of-Words |
removeLongWords |
Entfernen langer Wörter aus Dokumenten oder Bag-of-Words |
removeShortWords |
Entfernen kurzer Wörter aus Dokumenten oder Bag-of-Words |
removeInfrequentWords |
Entfernen von selten vorkommenden Wörtern aus einem Bag-of-Words-Modell |
erasePunctuation |
Löschen von Satzzeichen aus Text und Dokumenten |
| Funktionsname | Beschreibung |
|---|---|
str = "Hello, world" |
Deklarieren einer Zeichenfolgen-Variablen |
str = ["Hello","World"] |
Deklarieren eines Zeichenfolgen-Arrays |
str = string(C) |
Umwandeln eines Zeichenvektors C in eine Zeichenfolge |
str2double |
Umwandeln einer Zeichenfolge in Double-Zahlen |
strlength |
Rückgeben der Länge von Zeichenfolgen |
isstring |
Bestimmen, ob der Input ein Zeichenfolgen-Array ist |
join |
Kombinieren von Zeichenfolgen |
split |
Aufteilen von Zeichenfolgen in einem Zeichenfolgen-Array |
splitlines |
Aufteilen einer Zeichenfolge an Zeilenumbruchzeichen |
replace |
Finden und Ersetzen von Teilzeichenfolgen in einem Zeichenfolgen-Array |
contains |
Bestimmen, ob ein Muster in einer Zeichenfolge enthalten ist |
erase |
Löschen von Teilzeichenfolgen innerhalb von Zeichenfolgen |
extractBetween |
Extrahieren von Teilzeichenfolgen zwischen Indikatoren |
extractAfter |
Extrahieren von Teilzeichenfolgen nach der angegebenen Position |
extractBefore |
Extrahieren von Teilzeichenfolgen vor der angegebenen Position |
strcmp |
Vergleichen von Zeichenfolgen |
regexp |
Regulären Ausdruck abgleichen (Groß-/Kleinschreibung beachten) |