Zurück zur Übersicht
Wie LLMs trainiert werden
Entdecke, wie neuronale Netze lernen und sich durch menschliches Feedback verbessern
Trainingsdaten & Skalierung
LLMs werden mit Milliarden von Wörtern aus dem Internet trainiert. Erkunde die Datenquellen.
GPT-3 wurde mit ungefähr 333 Milliarden Wörtern aus diesen Quellen trainiert. Klicke auf eine Quelle, um mehr zu erfahren.
Common Crawl410B Wörter
Qualität: niedrig · Gewicht im Training: 60%
WebText219B Wörter
Qualität: hoch · Gewicht im Training: 22%
Books112B Wörter
Qualität: hoch · Gewicht im Training: 8%
Books255B Wörter
Qualität: hoch · Gewicht im Training: 8%
Wikipedia3B Wörter
Qualität: sehr hoch · Gewicht im Training: 3%
Gesamt: ~333 Milliarden Wörter · ~500 Milliarden Tokens · ~680 GB Text
RLHF — Lernen aus menschlichem Feedback
Bewerte Modell-Ausgaben und sieh, wie Präferenzen das Verhalten formen.
RLHF (Reinforcement Learning from Human Feedback) funktioniert, indem Menschen zwei Modell-Ausgaben gezeigt werden und gefragt wird, welche besser ist. Deine Präferenzen helfen dem Modell zu lernen, was "gut" aussieht. Probiere es selbst:
Frage:
Wie kann ich meinen Code schneller machen?
Gesammelte Präferenzen: 0