Technische Artikel

MathWorks Insights

Nutzung von KI in Halbleiterfertigungsprozessen


Autor:

  • Xiaoxing Wang, MathWorks

10 Minuten Lesezeit

Schlagwörter:

Zusammenfassung

  • Künstliche Intelligenz kann in der Halbleiterfertigung aus hochfrequenten Sensorzeitreihendaten verwertbare Muster extrahieren.
  • Die Schätzung des Ätzprofils kann als Regressionsproblem formuliert werden, und Low-Code-Workflows können die Modellentwicklung und -optimierung beschleunigen.
  • Die unüberwachte Anomalieerkennung mithilfe von aus Vibrationssignalen extrahierten Merkmalen kann seltene Fehlermodi auch mit begrenzten gekennzeichneten Daten erkennen.
  • Bei der Prozessoptimierung handelt es sich oft um multikriterielle Probleme (Pareto-Optimalität), die Zielkonflikte zwischen konkurrierenden Zielen aufzeigen, während bei der Implementierungsbetrachtung die Frage behandelt wird, wie Modelle in der Praxis eingesetzt werden.

Einleitung

Die Halbleiterfertigung ist eine der fundamentalen Industrien, die die Weltwirtschaft stützen, und ihre Prozesse erfordern eine äußerst präzise und komplexe Steuerung. Da die Miniaturisierung von Bauelementen und die Entwicklung von Mehrschichtstrukturen immer weiter fortschreiten, sind selbst für einen einzelnen Wafer mehrere Prozesse und Anlagenteile erforderlich, und kleine Prozessabweichungen können sich direkt auf Ausbeute und Qualität auswirken. Um dieser zunehmenden Komplexität zu begegnen, wurden in den letzten Jahren die Bemühungen um eine „intelligente Fertigung“ mithilfe künstlicher Intelligenz (KI) auf Basis großer Datenmengen aus Fertigungsprozessen und -anlagen beschleunigt.

Eine wichtige Informationsquelle bei der Steuerung von Halbleiterfertigungsprozessen sind Bilddaten. So wurden beispielsweise Systeme beschrieben, die Prozessanomalien in einem frühen Stadium erkennen, indem sie während der Fertigung aufgenommene Bilder in vordefinierte Fehlertypen einordnen.¹ Im Gegensatz dazu konzentriert sich dieser Artikel primär auf eindimensionale Signale, die von Sensoren erfasst werden.

In der Halbleiterfertigung werden vielfältige Daten – wie Temperatur, Druck, Durchflussrate und Drehzahl – als Zeitreihendaten mit hoher Abtastrate aufgezeichnet. Solche Daten weisen oft komplexe Strukturen auf, die durch hohe Dimensionalität, Nichtlinearität und Rauschen gekennzeichnet sind. Daher kann es schwierig sein, das Gesamtverhalten allein mit herkömmlichen statistischen Methoden zu verstehen, und KI hat als effektives Mittel zur automatischen Extraktion latenter Muster und Korrelationen in den Daten Aufmerksamkeit erregt (Abbildung 1).

Definitionen von künstlicher Intelligenz, Machine Learning und Deep Learning in einer Abbildung mit allen drei Konzepten.

Abbildung 1: Beziehung zwischen KI, maschinellem Lernen und Deep Learning.

Überblick über KI-Technologien (Maschinelles Lernen und Deep Learning)

KI bezeichnet Mechanismen, die aus Daten lernen, um Entscheidungen zu treffen und Vorhersagen zu fällen. Eine ihrer Kerntechnologien ist maschinelles Lernen (Abbildung 2). Maschinelles Lernen ist eine Methodik, um automatisch Muster in Daten zu erkennen und Modelle zu erstellen, die bei neuen Daten angemessene Entscheidungen treffen können.² Grob lässt es sich in überwachtes Lernen, das Ausgaben für unbekannte Eingaben vorhersagt, und unüberwachtes Lernen, das in den Daten inhärente Strukturen und Muster extrahiert, unterteilen. Überwachtes Lernen lässt sich weiter unterteilen in Klassifizierung, bei der die Ausgabe eine diskrete Kategorie ist, und Regression, bei der die Ausgabe ein kontinuierlicher Wert ist.

Machine-Learning-Techniken: unbeaufsichtigtes Lernen (Clustering) und beaufsichtigtes Lernen (Klassifizierung und Regression).

Abbildung 2: Mechanismus des maschinellen Lernens.

Die Modellleistung verbessert sich oft, wenn repräsentativere Trainingsdaten zur Verfügung stehen. Abbildung 3 veranschaulicht repräsentative Algorithmen des maschinellen Lernens. In vielen Fällen besteht ein Zielkonflikt zwischen Vorhersagegenauigkeit und Modellinterpretierbarkeit.³ Historisch gesehen erforderte die Erstellung geeigneter Modelle umfangreiche Fachkenntnisse in Statistik und verwandten Bereichen; in jüngster Zeit sind jedoch benutzerfreundliche Low-Code-Anwendungen entstanden.

Grafische Darstellung von Machine-Learning-Algorithmen, bei denen die Interpretierbarkeit auf der x-Achse und ihre Vorhersagekraft auf der y-Achse aufgetragen sind.

Abbildung 3: Repräsentative Algorithmen des maschinellen Lernens, die den Zielkonflikt zwischen Vorhersageleistung und Interpretierbarkeit verdeutlichen.

Anwendung von KI auf Sensordaten

In diesem Abschnitt werden drei Methoden zur Anwendung von KI auf Sensordaten in der Halbleiterfertigung vorgestellt: Schätzung des Ätzprofils, unüberwachte Anomalieerkennung und Prozessoptimierung.

Abschätzung von Ätzprofilen

Die Halbleiterfertigungsprozesse lassen sich grob in „Front-End-Prozesse“, bei denen Schaltkreise auf Siliziumwafern gebildet werden, und „Back-End-Prozesse“, bei denen die gefertigten IC-Chips ausgeschnitten und verpackt werden, unterteilen. Zwischen diesen Prozessen werden Reinigungsschritte eingefügt, um die Geräteausbeute zu beeinflussen.⁴ Durch chemisches Ätzen werden unerwünschte Materialien von der Waferoberfläche entfernt, die bei der Vorverarbeitung entstanden sind. In den letzten Jahren haben sich Einzelwafer-Reinigungsverfahren, bei denen Chemikalien zugeführt werden, während sich einzelne Wafer drehen, als Standard etabliert.

Bei solchen Prozessen ist die Abschätzung der radialen Verteilung der Ätzrate über einen Wafer (Ätzprofil) für die Prozessoptimierung und die Qualitätskontrolle von entscheidender Bedeutung (Abbildung 4). Die Ätzraten hängen stark von den Rezeptvariablen ab, darunter chemische Eigenschaften, Temperatur, Flüssigkeitsdurchflussrate und Rotationsgeschwindigkeit des Wafers. Da maschinelles Lernen Beziehungen in Daten erkennen und Vorhersagen für neue Eingaben treffen kann, lässt sich die Schätzung von Ätzprofilen als Regressionsproblem formulieren, indem man den Waferradius und Rezeptvariablen als Eingaben und die Ätzprofile als Ausgaben verwendet (Abbildung 5).

Schema eines Nassreinigungsprozesses für einen einzelnen Wafer mit Düsenfluss, Waferrotation und Ätzprofilen.

Abbildung 4: Reinigungsprozess einzelner Wafer und Verteilung der Ätzrate.

Diagramm mit Trainings- und Inferenzdatentabellen, die zum Aufbau und zur Anwendung eines Vorhersagemodells verwendet wurden.

Abbildung 5: Regressionsrahmen zur Schätzung des Ätzprofils aus Rezeptvariablen.

Abbildung 6 (oben und Mitte) zeigt die Trainings- und Schätzergebnisse von Ätzprofilen unter Verwendung von MATLAB.® Low-Code-Regressionslern-App. Vier Profile mit mehreren Rezeptvariablen wurden als Trainingsdaten verwendet, während andere Profile als Testdaten verwendet wurden, um die Generalisierbarkeit des Modells zu überprüfen. Die Ergebnisse deuten darauf hin, dass das Modell angemessen trainiert wurde und es keine offensichtlichen Anzeichen für Überanpassung gibt. Die Genauigkeit des Modells hängt jedoch stark von der Wahl der Algorithmen und Hyperparameter ab. Beispielsweise kann die Vorhersageleistung durch die Optimierung von Parametern wie minimaler Blattgröße, Kernelfunktion und Anzahl der Schichten weiter verbessert werden. Die Bayes'sche Optimierung ist für die Hyperparameter-Einstellung effektiv, da sie optimale Werte effizienter ermitteln kann als herkömmliche Gittersuch- oder Zufallssuchmethoden. Abbildung 6 (unten) zeigt ein Werkzeug, das diesen Prozess automatisiert und so die Erstellung leistungsstarker Modelle mit weniger Versuchen ermöglicht.

Drei MATLAB Screenshots, die Diagramme zur Ätzrate, Ergebnisse der Modellbewertung und Hyperparameter-Optimierungspanels zeigen.

Abbildung 6: Modelltraining (oben) und Validierung (Mitte) mithilfe einer Low-Code-Anwendung sowie Hyperparameteroptimierung für verschiedene Modelle (unten).

Unüberwachte Anomalieerkennung mithilfe von Vibrationsdaten

Der stabile Betrieb von Halbleiterfertigungsanlagen ist für die Aufrechterhaltung der Prozessqualität unerlässlich, weshalb die Überwachung des Anlagenzustands unverzichtbar ist. Beispielsweise können bei Geräten mit rotierenden Bauteilen – wie Reinigungs- oder Ätzwerkzeugen – mechanische Anomalien an Motoren oder Lagern auftreten, die sich negativ auf Produktivität und Qualität auswirken. Anomalieerkennungsverfahren, die Zeitreihensignale wie Vibrationsdaten verwenden, sind deshalb effektiv, weil sie subtile Veränderungen in den Daten erfassen können, die mit herkömmlichen Schwellenwerten oder statistischen Prozesskontrollen möglicherweise nicht erkannt werden.⁵

Wenn abnormale Ereignisse selten sind, ist es schwierig, Daten zu gekennzeichneten Ausfällen zu sammeln. In diesen Fällen ist unüberwachtes Lernen besonders wertvoll, da die Modelle ausschließlich anhand von Daten aus dem Normalbetrieb trainiert werden können.

Abbildung 7 zeigt dreiachsige Schwingungsdaten, die vor und nach der Wartung an einer Industriemaschine erfasst wurden.⁶ In diesem Beispiel wird davon ausgegangen, dass die Daten vor der Wartung einen anormalen Zustand darstellen, während die Daten nach der Wartung einen normalen Zustand darstellen. Diese Vorgehensweise impliziert, dass für das Training des Modells ausschließlich Daten aus dem Normalzustand verwendet werden, während für die Validierung des Modells gemischte Daten aus Normal- und Abnormalzustand verwendet werden. Der Einsatz von KI beseitigt jedoch nicht die Notwendigkeit der Datenaufbereitung. Im Allgemeinen erfordern KI-Anwendungen eine Datenbereinigung (Vorverarbeitung) und Merkmalsextraktion.

Drei übereinanderliegende Zeitreihendiagramme zeigen Vibrationssignale über die Kanäle 1–3 im Vergleich zwischen dem Zustand vor und nach der Behandlung.

Abbildung 7: Drei-Achsen-Schwingungsdaten vor und nach der Wartung.

Merkmale sind numerische Darstellungen bestimmter Eigenschaften einzelner Datenproben.⁷ und können aus Analysen im Zeitbereich, im Frequenzbereich oder im Zeit-Frequenz-Bereich abgeleitet werden. Die Auswahl geeigneter Merkmale ist selbst für KI-Experten eine Herausforderung. Daher ist eine explorative Analyse – wie das Erstellen von Histogrammen oder das Berechnen grundlegender Statistiken wie Mittelwert und Varianz – oft ein guter Ausgangspunkt.⁸⁻⁹

In Abbildung 8 werden 12 Merkmale aus den Vibrationsdaten vor und nach der Wartung berechnet. Anschließend werden t-Tests für zwei Stichproben angewendet, um statistisch signifikante Unterschiede zwischen ihnen zu ermitteln. Danach wird die Wichtigkeit der Merkmale geordnet. Sobald besonders wichtige Merkmale identifiziert sind, kann erwartet werden, dass das Training eines Modells unter Verwendung dieser Merkmale die Genauigkeit verbessert. Ein repräsentatives Beispiel für eine unüberwachte Lernmethode ist der Autoencoder, der die Struktur neuronaler Netze ausnutzt.¹⁰ Bei Autoencodern wird der Rekonstruktionsfehler zwischen Eingaben und Ausgaben als Anomaliewert verwendet.

Screenshot einer Datenanalyseanwendung, die Zeitreihensignale, Histogrammverteilungen, ein Balkendiagramm zur Merkmalswichtigkeit und Zusammenfassungstabellen zeigt.

Abbildung 8: Feature-Untersuchung mithilfe der App Diagnostic Feature Designer.

Aus den Daten werden zwölfdimensionale Merkmale extrahiert. Die Daten werden zufällig im Verhältnis 9:1 in Trainings- und Testdatensätze aufgeteilt. Der Autoencoder wird ausschließlich mit Merkmalen aus normalen Daten trainiert (Abbildung 9). Wenn die Testmerkmale in das trainierte Modell eingegeben werden, unterscheidet sich der Rekonstruktionsfehler (Anomaliewert) deutlich zwischen den Bedingungen vor und nach der Wartung (Abbildung 10). Das heißt, obwohl das Modell nur mit normalen Daten nach der Wartung trainiert wurde, kann es durch Anwendung eines geeigneten Schwellenwerts Anomalien vor der Wartung erkennen.

Das Fenster „Trainingsfortschritt“ zeigt Metrikkurven über die Trainingsiterationen hinweg sowie Status, Fortschritt und Trainingsdetails an.

Abbildung 9. Lernkurve des Autoencoders (Entwicklung der Verlustfunktion; d. h. des mittleren quadratischen Fehlers).

Visualisierung der Anomalieerkennung mit Rekonstruktionsverlust über die Zeit, Verlustverteilung mit Schwellenwertlinie und einer Konfusionsmatrix der vorhergesagten Klassen.

Abbildung 10. Bewertung der Modellleistung anhand von Testdaten (oben), Verteilung der Anomaliewerte für normale und abnormale Klassen (unten links) und der Konfusionsmatrix (unten rechts).

Referenz 11 stellt einen alternativen, unüberwachten Ansatz zur Anomalieerkennung unter Verwendung einer One-Class-Support-Vektor-Maschine vor. Allerdings ist Vorsicht geboten, da die Hyperparameter-Einstellungen die Leistung erheblich beeinflussen. Abbildung 11 veranschaulicht, wie sich der Kernel-Skalenparameter auf den Anomaliebereich (Entscheidungsgrenze) auswirkt. Kleinere Kernel-Skalen erhöhen die Nichtlinearität.¹³

Zwei Streudiagramme zum Vergleich der Ergebnisse der Anomalieerkennung bei Kernel-Skalen von 0,2 und 4,0, mit normalen Punkten und schattierten Anomaliebereichen.

Abbildung 11. Veränderungen der Entscheidungsgrenze bei unterschiedlichen Kernel-Skalenwerten; kleinere Werte führen zu einer höheren Nichtlinearität.

Schließlich nutzt die Prognostik über die Anomalieerkennung hinaus sequentielle Beobachtungsdaten, um den aktuellen und zukünftigen Gesundheitszustand der Geräte zu modellieren. Sobald ein anwendungsspezifischer Ausfallschwellenwert definiert ist, kann die verbleibende Nutzungsdauer abgeschätzt werden (Abbildung 12). In diesem Fall können Sie die Bayes'sche Schätzung verwenden, um die Modellparameter sequenziell zu aktualisieren.¹⁴⁻¹⁵ Interessierte Leser werden auf folgende Adresse verwiesen: Referenz 16 Die

Diagramm zur Veranschaulichung der verbleibenden Nutzungsdauerprognose mit beobachteten Gesundheitswerten, einer Ausfallschwelle und zukünftigen Prognosekurven.

Abbildung 12. Beispiel für die Vorhersage der verbleibenden Nutzungsdauer von Geräten anhand von Zeitreihensignalen.

Prozessoptimierung

Deep Learning kann als Optimierungsproblem ausgedrückt werden, bei dem die Parameter (Gewichte und Bias) von Funktionen, die aus geschichteten Kombinationen linearer Transformationen und nichtlinearer Aktivierungsfunktionen konstruiert werden, durch Minimierung einer Verlustfunktion optimiert werden.¹⁷ Dementsprechend konzentriert sich dieser Abschnitt auf das Optimierungsproblem.

Bei Halbleiterfertigungsprozessen ist es oft notwendig, mehrere Ziele gleichzeitig zu optimieren, wie zum Beispiel die Abscheidungsrate und die Gleichmäßigkeit der Schichtdicke.¹⁸ In solchen Fällen müssen optimale Eingangsvariablen für mehrere Zielfunktionen ermittelt werden; allerdings ist eine optimale Lösung für ein Ziel im Allgemeinen nicht optimal für ein anderes. Dieses Konkurrenzverhältnis impliziert, dass die Verbesserung eines Ziels oft ein anderes verschlechtert; daher besteht das Ziel darin, die Kompromisslösungen – Pareto-optimale Lösungen – zu identifizieren, die eine Pareto-Front bilden.

Eine Pareto-optimale Lösung ist definiert als eine Lösung, bei der die Verbesserung einer Zielfunktion notwendigerweise mindestens eine andere Zielfunktion verschlechtert. Abbildung 13 (Einsatz) veranschaulicht ein Zwei-Ziel-Optimierungsproblem, bei dem sowohl \(f_₁\) als auch \(f_₂\) minimiert werden sollen, aber in einem Zielkonflikt stehen. Genetische Algorithmen sind eine bekannte Methode zur Identifizierung Pareto-optimaler Lösungen.¹⁹ Alternativ kann ein mehrkriterielles Optimierungsproblem in ein einkriterielles Problem umgewandelt werden, indem jedem Ziel Gewichte zugewiesen werden:

\(F(x) = \alpha f_1(x) + (1 - \alpha) f_2(x) \)

Durch die Änderung des Gewichts \( \alpha \) ändert sich das Kompromissverhältnis zwischen \(f_₁\) und \(f_₂\), wodurch mehrere Pareto-Lösungen entstehen. Die Abbildung zeigt, dass die mittels genetischer Algorithmen und Bayes'scher Optimierung ermittelten Pareto-Fronten gut übereinstimmen.

Vergleichsdiagramm der Optimierung, das f2 gegenüber f1 zeigt, mit Punkten aus einem genetischen Algorithmus, einer Bayes'schen Optimierung und einer bekannten Lösungskurve.

Abbildung 13. Pareto-optimale Lösungen einer zweidimensionalen multikriteriellen Zielfunktion.

Obwohl hier ein zweidimensionales Beispiel für multikriterielle Optimierung mit einer Variablen vorgestellt wird, lässt sich das gleiche Verfahren auf mehrdimensionale Zielfunktionen mit mehreren Variablen erweitern.²⁰:

$$ \begin{aligned} \min_{x_1,x_2}\quad& \{f_1(x_1,x_2),\,f_2(x_1,x_2)\} \\[1em] \text{wobei}\quad& f_1(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2-10x_1^{2} \\& f_2(x_1,x_2)=x_1^{4}+x_2^{4}+x_1x_2-(x_1x_2)^2 \\[1em] \text{unter der Nebenbedingung}\quad& 0\le x_1\le5,\qquad -5\le x_2\le0 \end{aligned} $$

Abbildung 14 zeigt, wie multikriterielle Optimierungsprobleme mithilfe von Low-Code-Methoden konstruiert werden können. Die GUI-basierte Anwendung namens Live Editor Task ermöglicht es dem Benutzer, verschiedene Lösungsalgorithmen per Mausbedienung auszuprobieren, während die konfigurierten Bedingungen automatisch in Code umgewandelt werden, wodurch die Transparenz des Modells gewährleistet wird.

Screenshot eines Optimierungstools, der die Ziel- und Nebenbedingungseinstellungen, die Solver-Auswahl und die Konfiguration für einen multikriteriellen Algorithmus zeigt.

Abbildung 14. Konstruktion von Optimierungsproblemen mit Low-Code-Methoden.

Systembereitstellung

Abschließend sollte die Systemintegration berücksichtigt werden. Der Einsatzort der entwickelten Algorithmen – Edge-Geräte, Server oder Cloud-Plattformen – hängt vom Datentransfervolumen, den Rechenanforderungen und den betrieblichen Einschränkungen ab. Wenn die Minimierung des Datentransfers von entscheidender Bedeutung ist, sollte die notwendige Vorverarbeitung auf dem Zielgerät durchgeführt werden, wobei nur die wesentlichen Daten zur Vorhersage an die Edge-Geräte übertragen werden, damit Sie die Ergebnisse dann an einen Server weiterleiten und mit den Endbenutzern teilen können.

Wichtig ist auch zu berücksichtigen, wie die Vorhersageergebnisse im operativen Geschäft genutzt werden, z. B. ob die Ergebnisse auf Desktop-PCs oder tragbaren Tablets angezeigt werden und ob die Benutzer über ausreichendes Fachwissen verfügen. Eine detaillierte Fallstudie zur Implementierung finden Sie unter Referenz 21 Die

Fazit

Künstliche Intelligenz wird zunehmend in der Halbleiterfertigung eingesetzt, um subtile Prozessabweichungen und Geräteanomalien zu erkennen, die mit herkömmlichen Methoden schwer zu identifizieren sind. Die Beispiele in diesem Artikel veranschaulichen, wie Sensorzeitreihendaten genutzt werden können, um Modelle zu entwickeln, die eine Qualitätsverbesserung und einen zuverlässigeren Betrieb unterstützen.

Maschinelles Lernen und Deep Learning, angewendet auf Zeitreihendaten, können für Aufgaben wie die Schätzung von Ätzprofilen und die vibrationsbasierte Überwachung eingesetzt werden. Um verlässliche Ergebnisse zu erzielen, konzentrieren Sie sich auf die Sammlung repräsentativer Daten, die sorgfältige Vorverarbeitung und Merkmalsextraktion sowie auf die Nutzung von Domänenexpertise zur Definition von Validierung und Schwellenwerten. Wenn die Kennzeichnung schwierig ist, bieten unüberwachte Methoden eine praktische Alternative. Das kontinuierliche Wachstum der Datenverfügbarkeit und der KI-Fähigkeiten dürfte die Autonomie bei der Prozessoptimierung weiter erhöhen.

Diese Studie verwendete MATLAB, Statistics and Machine Learning Toolbox™, Predictive Maintenance Toolbox™, Deep Learning Toolbox™, Optimization Toolbox™ und Global Optimization Toolbox™. Die verwendeten Daten können von der MathWorks Website heruntergeladen werden (siehe Referenzen). 6 Und 20).

Literatur

  1. Imoto, K., und Nakai, T., „Automatisiertes Fehlerklassifizierungssystem für Halbleiterfertigungsprozesse mittels Deep Learning“, Toshiba-Testbericht, Band 74, Nr. 5, 2019.

  2. Sanada, T., und Jimbo, Y., „Einzelwafer-Reinigungstechnologien in Halbleiterfertigungsprozessen“, NAGARE, Bd. 42, S. 187, 2023.

  3. DeLaus, MD, „Maschinelles Lernen zur automatisierten Anomalieerkennung in der Halbleiterfertigung“, Masterarbeit, Massachusetts Institute of Technology (MIT), 2019.

  4. Adachi, Y., „Eine Einführung in die Vorverarbeitung für maschinelles Lernen“, Lec Telecom, S. 30, 2019.

  5. Wang, X., Zeitschrift für Messtechnik, Band 48, Nr. 7, S. 20–26, 2020.

  6. Konishi, S., Einführung in die multivariate Analyse: Von linear zu nichtlinear, Iwanami Shoten, S. 212–221, 2010.

  7. Gebraeel, N., IEEE Transactions on Automation Science and Engineering, Band 3, S. 382–393, 2006.

  8. Gebraeel, N., et al., IIE-Transaktionen, Bd. 37, S. 543–557, 2005.

  9. Agentur zur Förderung der Informationstechnologie (IPA), AI white paper, Japan, S. 91, 2020.

  10. Moriya, T., „Anwendung von maschinellem Lernen in der Halbleiterfertigung“, Angewandte Physik, Band 90, Nr. 5, 2021.

Veröffentlicht 2026


Mehr entdecken