Skip to content
Zurück zur Übersicht

Wie LLMs trainiert werden

Entdecke, wie neuronale Netze lernen und sich durch menschliches Feedback verbessern

Trainingsdaten & Skalierung

LLMs werden mit Milliarden von Wörtern aus dem Internet trainiert. Erkunde die Datenquellen.

GPT-3 wurde mit ungefähr 333 Milliarden Wörtern aus diesen Quellen trainiert. Klicke auf eine Quelle, um mehr zu erfahren.

Common Crawl410B Wörter
Qualität: niedrig · Gewicht im Training: 60%
WebText219B Wörter
Qualität: hoch · Gewicht im Training: 22%
Books112B Wörter
Qualität: hoch · Gewicht im Training: 8%
Books255B Wörter
Qualität: hoch · Gewicht im Training: 8%
Wikipedia3B Wörter
Qualität: sehr hoch · Gewicht im Training: 3%
Gesamt: ~333 Milliarden Wörter · ~500 Milliarden Tokens · ~680 GB Text

RLHF — Lernen aus menschlichem Feedback

Bewerte Modell-Ausgaben und sieh, wie Präferenzen das Verhalten formen.

RLHF (Reinforcement Learning from Human Feedback) funktioniert, indem Menschen zwei Modell-Ausgaben gezeigt werden und gefragt wird, welche besser ist. Deine Präferenzen helfen dem Modell zu lernen, was "gut" aussieht. Probiere es selbst:

Frage:

Wie kann ich meinen Code schneller machen?

Gesammelte Präferenzen: 0