Was sind Foundation Models?
Ein Foundation Model ist ein großes Modell, das in großem Maßstab auf breit gefächerten Daten vortrainiert wurde und an eine Vielzahl von nachgelagerten Aufgaben angepasst werden kann. Große Sprachmodelle (LLMs) und große multimodale Modelle sind die klassischen Beispiele. Der Begriff, der 2021 in Stanford geprägt wurde, beschreibt einen Wandel: Anstatt für jede Aufgabe ein maßgeschneidertes Modell zu trainieren, bauen Organisationen auf einer gemeinsamen, universellen Basis auf – und spezialisieren diese dann durch Prompting, Retrieval oder Fine-tuning.
Definition
Ein Foundation Model ist ein großes, universelles Modell, das auf breit gefächerten Daten vortrainiert wurde und als Basis dient, die – über Prompting, Retrieval oder Fine-tuning – an viele nachgelagerte Aufgaben angepasst werden kann.
Wichtigste Erkenntnisse
- Foundation Models sind universelle Basen, die an viele Aufgaben angepasst werden.
- LLMs und multimodale Modelle sind die führenden Beispiele.
- Die meisten basieren auf der Transformer-Architektur.
- Fähigkeiten entstehen mit der Skalierung von Daten, Parametern und Rechenleistung.
- Sie passen sie durch Prompting, Retrieval (RAG) oder Fine-tuning an – selten durch Training von Grund auf.
Kontext
Vor den Foundation Models trainierten Teams spezialisierte Modelle für jede einzelne Aufgabe. Das Foundation-Model-Paradigma kehrt dies um: Ein großes Modell wird einmal auf breit gefächerten Daten vortrainiert und dann überall wiederverwendet. Diese Wiederverwendung ist der Grund, warum heute eine Handvoll Modelle die Basis für die meisten KI-Produkte bilden.
Es konzentriert auch Fähigkeiten – und Risiken. Da so viel auf wenigen Basen aufbaut, übertragen sich deren Vorurteile, Fehler und Sicherheitseigenschaften auf nachgelagerte Anwendungen, weshalb Governance und Evaluierung so wichtig sind.
Architektur
Pretraining (Vortraining): Ein Modell mit Millionen bis Billionen von Parametern lernt allgemeine Muster aus riesigen Datensätzen, typischerweise mit selbstüberwachten Zielen wie der Next-Token-Prediction. Der Attention-Mechanismus des Transformers macht dies skalierbar.
Adaptation (Anpassung): Dieselbe Basis wird für die Nutzung spezialisiert – durch Zero-/Few-Shot-Prompting, Retrieval-Augmented Generation für aktuelles oder privates Wissen oder Fine-tuning für Verhalten und Domäne. Agenten betten das Modell in Tools und ein Harness ein.
Komponenten
Vorteile
- Eine einzige Basis, die für viele Aufgaben wiederverwendet wird.
- Starke allgemeine Fähigkeiten direkt einsatzbereit.
- Schnelle Anpassung ohne Training von Grund auf.
- Multimodale Varianten decken Text, Bild, Audio und mehr ab.
Risiken
- Konzentriertes Risiko: Fehler übertragen sich auf alles, was darauf aufbaut.
- Kostspielig im Pretraining; nur wenige Organisationen können dies leisten.
- Übernehmen Biases und Lücken aus den Trainingsdaten.
- Das Wissen ist ohne Retrieval auf den Zeitpunkt des Trainings beschränkt.
Tools & Technologien
Beispiele
- Nutzung eines einzigen LLMs für Zusammenfassung, Klassifizierung und Entwurfserstellung im gesamten Unternehmen.
- Anpassung eines Basismodells an eine Domäne mittels Retrieval statt durch erneutes Training.
- Entwicklung eines Agenten auf Basis eines Frontier-Modells, ergänzt um Tools und Speicher (Memory).
FAQs
- Ist ein Foundation Model dasselbe wie ein LLM?
- Ein LLM ist die am weitesten verbreitete Art von Foundation Model, spezialisiert auf Sprache. Foundation Models umfassen jedoch auch multimodale und andere Allzweckmodelle.
- Warum werden sie „Foundation Models“ genannt?
- Weil sie als gemeinsame Basis dienen, auf der viele Anwendungen aufbauen, anstatt ein für eine einzelne Aufgabe trainiertes Modell zu sein.
- Muss ich selbst eines trainieren?
- Fast nie. Das Pretraining ist extrem kostspielig; fast der gesamte Wert entsteht durch die Anpassung einer bestehenden Basis mittels Prompting, Retrieval oder Fine-Tuning.
- Wie hängen Agenten mit Foundation Models zusammen?
- Ein Agent nutzt ein Foundation Model als seinen logischen Kern (Reasoning Core), eingebettet in Tools, Speicher und eine Kontrollschleife – das Harness –, um Aktionen auszuführen.