nanochat

nanochat

Andrej Karpathy · Sonstiges · Chatbot

nanochat ist ein quelloffenes Full-Stack-Framework zum Trainieren von LLM von Andrej Karpathy, das ein Sprachmodell im ChatGPT-Stil von Grund auf aufbaut. Es deckt die gesamte Pipeline ab, von der Tokenisierung und dem Vortraining bis zum Finetuning, der Evaluierung und der Inferenz, und zwar in einer einzigen Codebasis von rund 8.000 Zeilen. Sie mieten einen GPU-Knoten, führen ein Skript aus, und wenige Stunden später können Sie über eine Weboberfläche oder die Kommandozeile mit dem gerade trainierten Modell chatten.

Vorschau der Oberfläche von nanochat

Über nanochat

Was ist nanochat

nanochat ist das einfachste Versuchssetup zum Trainieren großer Sprachmodelle. Es ist für einen einzigen GPU-Knoten ausgelegt, der Code ist knapp und leicht veränderbar, und es durchläuft jede wichtige LLM-Phase: Tokenisierung, Vortraining, Mitteltraining, überwachtes Finetuning, optionales bestärkendes Lernen, Evaluierung und Inferenz. Karpathy nennt es das beste ChatGPT, das 100 Dollar kaufen können.

Der Punkt ist nicht, mit Frontier-Modellen zu konkurrieren. Ein nanochat-Modell, das ein paar Stunden trainiert wurde, ist eine kleine, neugierige Sache, die einfache Gespräche führt, Geschichten erzählt und schlichte Fragen beantwortet. Was Sie stattdessen bekommen, ist eine vollständige, lesbare Trainingspipeline, die Sie tatsächlich verstehen und ändern können. Deshalb entwickelt es sich zum Abschlussprojekt von Karpathys LLM101n-Kurs.

Die ehrliche Grenze: Das ist ein Lern- und Forschungswerkzeug, kein Produktionsmodell. Karpathy selbst empfiehlt nicht, es mit eigenen Texten zu finetunen. Ein so kleines Modell ahmt die Oberflächenästhetik nach, es erfasst nicht das tiefere Schlussfolgern eines Spitzen-LLM. Wenn Sie das wollen, finetunen Sie ein größeres offenes Modell wie Llama 3 oder nutzen Sie Retrieval mit einem größeren System.

Erste Schritte

  1. Starten Sie einen Cloud-GPU-Server mit einem einzigen 8XH100-Knoten (der Marktpreis liegt bei rund 24 Dollar pro Stunde).
  2. Klonen Sie das Repository von GitHub und installieren Sie den Projektmanager uv, falls Sie ihn noch nicht haben.
  3. Führen Sie das Skript runs/speedrun.sh aus, das Datenvorbereitung, Training und Finetuning von Anfang bis Ende übernimmt.
  4. Warten Sie ein paar Stunden. Das Skript trainiert ein Modell auf GPT-2-Niveau und meldet seine Werte.
  5. Starten Sie den Webserver oder die CLI und chatten Sie mit Ihrem frisch trainierten Modell.

Produktinformationen

Ein kurzer Überblick über Preise, unterstützte Plattformen und die Leistung von nanochat.

Kostenloser TarifJa
Bezahlte Tarife$0 (MIT-licensed, you pay only for the GPU you rent; roughly $48 for a 2-hour 8XH100 run)
PlattformLinux (CUDA GPU node)
EntwicklerAndrej Karpathy
KategorieSonstiges · Chatbot
VeröffentlichungsdatumOct 2025
Zuletzt aktualisiertMar 2026
Website-Besuche649.3M
Globales Website-Ranking50
API-VerfügbarkeitNein

Am besten für

Die Nutzer, Aufgaben und Szenarien, für die dieses Tool am besten passt.

Nutzer

  • Studierende des maschinellen Lernens
  • Forschende und Hobbyisten
  • Kleine Teams, die eigene Modelle erkunden

Aufgaben

  • Ein Sprachmodell der GPT-2-Klasse trainieren
  • Die LLM-Pipeline studieren
  • Trainingsanpassungen vergleichen

Szenarien

  • Ihren ersten durchgängigen Trainingslauf starten
  • Eine Klasse unterrichten oder einen Workshop leiten
  • Am Wochenende experimentieren

Wichtigste Funktionen

Ein Skript, die ganze Pipeline

Der nanochat-Speedrun verbindet den gesamten Ablauf auf einem frischen Server. Er bereitet Daten vor, trainiert einen Tokenizer, trainiert den Transformer vor, führt Mitteltraining und Finetuning aus und erzeugt ein Modell, mit dem Sie sprechen können. Ein einziger Befehl ersetzt das übliche Flickwerk aus getrennten Werkzeugen, und genau das ist der Grund, alles in einem einzigen Repository zu halten, statt es über verschiedene Projekte zu verteilen.

Der Tiefenregler

nanochat ist darauf eingerichtet, eine ganze Familie rechenoptimaler Modelle zu trainieren, indem man eine einzige Einstellung ändert: --depth, die Zahl der Schichten im Transformer. Alles andere, darunter Breite, Attention-Köpfe, Lernraten-Zeitpläne und Trainingshorizont, wird automatisch berechnet. Sie wollen GPT-2-Niveau? Stellen Sie die Tiefe auf 26. Ungefähr dort liegt die Leistungsfähigkeit von GPT-2.

Rust-Tokenizer und saubere Datenvorbereitung

Der Tokenizer ist von Grund auf in Rust geschrieben, um schnell zu sein, und die Datenpipeline packt eine Teilmenge des FineWeb-Edu-Datensatzes in kompakte Parquet-Dateien fürs Streaming um. Das ist die wenig glamouröse Klempnerarbeit. Aber es ist der Teil, den die meisten Tutorials auslassen, und hier ist er vollständig.

Inferenz-Engine mit Weboberfläche

Das Training endet mit etwas, das Sie wirklich nutzen können. nanochat liefert eine effiziente Inferenz-Engine mit KV-Cache sowie eine CLI und eine Weboberfläche im ChatGPT-Stil. Dazu kommt eine leichte Python-Sandbox für Tool-Aufrufe, sodass das Modell versucht, Code auszuführen. Dieses letzte Detail ist eine schöne Sache.

Optionale RL-Phase

Über das überwachte Finetuning hinaus können Sie eine optionale Phase des bestärkenden Lernens mit dem GRPO-Algorithmus auf dem Mathematik-Datensatz GSM8K ausführen. Es ist eine Bonusepisode und keine Kernanforderung, aber sie zeigt, wie man ein kleines Modell bei bewertbaren Aufgaben voranbringen kann, was wirklich nützlich ist, wenn Ihre Forschung Schlussfolgern oder Mathematik berührt.

Markdown-Bericht

Nach dem Training erzeugt nanochat einen einzigen Markdown-Bericht, der den Lauf zusammenfasst. Er liest sich wie eine Punktekarte und deckt Modellgröße, Trainingszeit und Ergebnisse in Benchmarks wie MMLU, ARC-Easy und GSM8K ab. Das macht Vergleiche leicht. Heben Sie ihn auf.

MIT-Lizenz und leicht veränderbar

Das gesamte Projekt ist unter der MIT-Lizenz offen und umfasst rund 8.000 Zeilen, überwiegend Python mit etwas Rust. Der Code ist zum Lesen, Forken und Verändern gedacht. Karpathy hat den Großteil von Hand geschrieben, und die Struktur bleibt nah an der Hardware, was bedeutet, dass es wenig verborgene Magie gibt, die Sie überrascht, wenn Sie anfangen zu stöbern.

Vor- und Nachteile

Vorteile

  • Deckt die gesamte LLM-Pipeline ab, vom Tokenizer bis zur Chat-Oberfläche, in einem kleinen Repository.
  • Trainiert ein Modell der GPT-2-Klasse für rund 100 Dollar GPU-Miete, weit unter dem, was es 2019 kostete.
  • Braucht nur einen einzigen GPU-Knoten, sodass Sie die Komplexität des verteilten Trainings überspringen.
  • Die MIT-Lizenz und lesbarer Code machen das Forken und Anpassen für eigene Experimente leicht.
  • Führt eine aktive Speedrun-Rangliste, die zeigt, wie schnell andere dieselbe Aufgabe vorangebracht haben.

Nachteile

  • Es ist kein Produktionsmodell. Das Ergebnis ist ein kleines Lernmodell, kein Rivale für GPT-4 oder Claude, also erwarten Sie keine ausgefeilten Antworten.
  • Sie brauchen weiterhin echte GPU-Hardware oder ein Cloud-Konto; auf einem Laptop oder Handy lässt sich das Training nicht ausführen.
  • Das Finetuning auf einen persönlichen Schreibstil klappt nicht gut, weil das Basismodell zu klein ist, um mehr als Oberflächenmuster aufzunehmen.
  • Das Setup setzt etwas Sicherheit mit Linux, Python und der Kommandozeile voraus, was nicht technische Nutzer ausschließt.

Häufige Fragen

nanochat wird verwendet, um ein kleines Sprachmodell im ChatGPT-Stil von Grund auf zu trainieren und auszuführen. Man nutzt es, um zu lernen, wie LLM von Anfang bis Ende arbeiten, um Trainingsideen günstig zu testen und um aus einem einzigen Skript einen funktionierenden Chatbot zu bauen.

Ähnliche Inhalte

Entdecke passende Tools, Skills und Artikel zu nanochat.

Alternativen zu nanochat

BinkBink

BinkBink

BinkBink · Sonstiges
Empfehlung der Redaktion

BinkBink ist eine kostenlose Online-Spielplattform und ein KI-Spielmacher, mit dem jeder eine kurze Textbeschreibung in ein spielbares Browser-Spiel verwandeln kann. Sie springen in Hunderte von der Community erstellte Spiele. Oder Sie beschreiben Ihre eigene Idee, spielen sie in Sekunden und teilen sie dann mit Freunden. Sie wollen Ihr eigenes Spiel erstellen? Sie müssen nicht programmieren. Kein Einrichten einer Engine, kein Download, kein Aufwand.

Kostenlos / $0Details ansehen
Audiogen

Audiogen

Audiogen Inc. · Sonstiges

Audiogen ist ein KI-Musikgenerator des Unternehmens Audiogen Inc., eines kleinen Forschungsteams, das rund 2,5 Jahre damit verbrachte, ein eigenes generatives Musikmodell zu trainieren und eine Web-Oberfläche darum herum zu entwerfen. Statt eines einfachen Textfelds verwandelt dieses KI-Musik-Tool die Zeitleiste in eine anfängerfreundliche Generative Audio Workstation, kurz GAW, in der Inpainting, Verlängern, Remixen und Stem-Bearbeitung eher wie Malen auf einer Leinwand funktionieren. Das Produkt ist noch in der Beta, der Zugang läuft also über eine Warteliste oder eine Einladung. Bezahlpläne sind noch nicht veröffentlicht.

Kostenlos / Free (beta)Details ansehen
Aiml API

Aiml API

AIMLAPI OÜ · Sonstiges

Aiml API ist eine einheitliche KI-Modell-API, die über 1000 Modelle von OpenAI, Google, Anthropic und anderen hinter einem einzigen Endpunkt und einer einzigen Rechnung bündelt. Sie schreiben Code gegen ein einziges OpenAI-kompatibles Schema und wechseln dann zwischen Chat-, Bild-, Video- und Audiomodellen, indem Sie eine Modellzeichenfolge ändern. Sie passt zu Entwicklern und kleinen Teams, die multimodalen Zugriff wollen, ohne ein Dutzend getrennte Anbieterkonten zu verwalten, und sie beseitigt den üblichen Rechnungsstress beim Testen mehrerer Anbieter. Ein Schlüssel deckt alles ab.

Kostenlos / $0 - $200/moDetails ansehen