nanochat

nanochat

Andrej Karpathy · Otro · Chatbot

nanochat es un framework de código abierto y de pila completa para entrenar LLM, creado por Andrej Karpathy, que construye un modelo de lenguaje estilo ChatGPT desde cero. Cubre todo el pipeline, desde la tokenización y el preentrenamiento hasta el ajuste fino, la evaluación y la inferencia, en una sola base de código de unas 8.000 líneas. Alquilas un nodo con GPU, ejecutas un script y unas horas después puedes chatear con el modelo que acabas de entrenar desde una interfaz web o la línea de comandos.

Vista previa de la interfaz de nanochat

Acerca de nanochat

Qué es nanochat

nanochat es la configuración experimental más simple para entrenar modelos de lenguaje grandes. Está pensado para un solo nodo con GPU, el código es mínimo y fácil de modificar, y recorre todas las etapas importantes de un LLM: tokenización, preentrenamiento, entrenamiento intermedio, ajuste fino supervisado, aprendizaje por refuerzo opcional, evaluación e inferencia. Karpathy lo llama el mejor ChatGPT que 100 dólares pueden comprar.

La idea no es competir con modelos de frontera. Un modelo nanochat entrenado durante unas horas es algo pequeño y curioso que mantiene conversaciones básicas, cuenta historias y responde preguntas sencillas. Lo que obtienes es un pipeline de entrenamiento completo y legible que de verdad puedes entender y cambiar. Por eso empieza a perfilarse como el proyecto final del curso LLM101n de Karpathy.

El límite honesto: esto es una herramienta de aprendizaje e investigación, no un modelo de producción. El propio Karpathy no recomienda entrenarlo con tus propios textos. Un modelo tan pequeño imita el estilo superficial, no capta el razonamiento profundo que tiene un LLM de primer nivel. Si buscas eso, ajusta un modelo abierto más grande como Llama 3 o usa recuperación con un sistema mayor.

Primeros pasos

  1. Levanta un servidor de GPU en la nube con un solo nodo 8XH100 (el precio de mercado ronda los 24 dólares por hora).
  2. Clona el repositorio desde GitHub e instala el gestor de proyectos uv si aún no lo tienes.
  3. Ejecuta el script runs/speedrun.sh, que se encarga de la preparación de datos, el entrenamiento y el ajuste fino de principio a fin.
  4. Espera unas horas. El script entrena un modelo de nivel GPT-2 y reporta sus puntuaciones.
  5. Arranca el servidor web o la CLI y chatea con tu modelo recién entrenado.

Información del producto

Un vistazo rápido a los precios, las plataformas compatibles y el rendimiento de nanochat.

Plan gratuitoSí
Planes de pago$0 (MIT-licensed, you pay only for the GPU you rent; roughly $48 for a 2-hour 8XH100 run)
PlataformaLinux (CUDA GPU node)
DesarrolladorAndrej Karpathy
CategoríaOtro · Chatbot
Fecha de lanzamientoOct 2025
Última actualizaciónMar 2026
Visitas al sitio web649.3M
Ranking global del sitio50
Disponibilidad de la APINo

Ideal para

Los usuarios, tareas y casos de uso en los que esta herramienta encaja mejor.

Usuarios

  • Estudiantes de aprendizaje automático
  • Investigadores y aficionados
  • Equipos pequeños que exploran modelos personalizados

Tareas

  • Entrenar un modelo de lenguaje de clase GPT-2
  • Estudiar el pipeline de un LLM
  • Comparar ajustes de entrenamiento

Casos de uso

  • Ejecutar tu primer trabajo de entrenamiento de principio a fin
  • Dar clase o impartir un taller
  • Experimentar el fin de semana

Funciones clave

Un script, todo el pipeline

El speedrun de nanochat ata todo el proceso en un servidor recién creado. Prepara los datos, entrena un tokenizador, preentrena el transformer, ejecuta el entrenamiento intermedio y el ajuste fino, y produce un modelo con el que puedes hablar. Un solo comando sustituye el habitual mosaico de herramientas separadas, que es justo el motivo de mantenerlo todo en un único repositorio en lugar de repartirlo entre proyectos.

El dial de profundidad

nanochat está configurado para entrenar toda una familia de modelos de cómputo óptimo cambiando un solo ajuste: --depth, el número de capas del transformer. Todo lo demás, incluidos el ancho, las cabezas de atención, los esquemas de tasa de aprendizaje y el horizonte de entrenamiento, se calcula de forma automática. ¿Quieres nivel GPT-2? Pon la profundidad en 26. Ahí es más o menos donde cae la capacidad de GPT-2.

Tokenizador en Rust y preparación de datos limpia

El tokenizador está escrito desde cero en Rust para ganar velocidad, y el pipeline de datos reempaqueta un subconjunto del dataset FineWeb-Edu en archivos Parquet compactos para el streaming. Es la fontanería poco glamurosa. Pero es la parte que casi todos los tutoriales se saltan, y aquí está completa.

Motor de inferencia con interfaz web

El entrenamiento termina con algo que de verdad puedes usar. nanochat incluye un motor de inferencia eficiente con caché KV, además de una CLI y una interfaz web estilo ChatGPT. También trae un entorno de pruebas ligero de Python para llamadas a herramientas, así el modelo intenta ejecutar código. Ese último detalle es un buen toque.

Etapa de RL opcional

Más allá del ajuste fino supervisado, puedes ejecutar una etapa opcional de aprendizaje por refuerzo con el algoritmo GRPO sobre el dataset de matemáticas GSM8K. Es una etapa extra más que un requisito central, pero muestra cómo se puede llevar a un modelo pequeño en tareas calificables, algo realmente útil si tu investigación toca el razonamiento o las matemáticas.

Informe en Markdown

Después del entrenamiento, nanochat genera un único informe en Markdown que resume la ejecución. Se lee como un marcador, con el tamaño del modelo, el tiempo de entrenamiento y los resultados en pruebas como MMLU, ARC-Easy y GSM8K. Así las comparaciones son fáciles. Guárdalo.

Licencia MIT y fácil de modificar

Todo el proyecto está abierto bajo la licencia MIT y ocupa unas 8.000 líneas, sobre todo Python con algo de Rust. El código está hecho para leerse, bifurcarse y modificarse. Karpathy escribió la mayor parte a mano, y la estructura se mantiene cerca del metal, lo que significa que hay poca magia oculta que te sorprenda cuando empieces a trastear.

Ventajas y desventajas

Ventajas

  • Cubre todo el pipeline de un LLM, del tokenizador a la interfaz de chat, en un repositorio pequeño.
  • Entrena un modelo de clase GPT-2 por unos 100 dólares de alquiler de GPU, muy por debajo de lo que costaba en 2019.
  • Solo necesita un nodo con GPU, así que te ahorras la complejidad del entrenamiento distribuido.
  • La licencia MIT y un código legible facilitan bifurcarlo y adaptarlo a tus propios experimentos.
  • Mantiene una tabla de clasificación activa del speedrun que muestra hasta dónde han llegado otros con la misma tarea.

Desventajas

  • No es un modelo de producción. El resultado es un modelo pequeño para aprender, no un rival de GPT-4 o Claude, así que no esperes respuestas pulidas.
  • Aún necesitas hardware GPU real o una cuenta en la nube; no hay forma de entrenarlo en un portátil ni en un móvil.
  • Ajustarlo para imitar un estilo de escritura personal no sale bien, porque el modelo base es demasiado pequeño para absorber más que patrones superficiales.
  • La configuración presupone cierta soltura con Linux, Python y la línea de comandos, lo que deja fuera a los usuarios no técnicos.

Preguntas frecuentes

nanochat sirve para entrenar y ejecutar un modelo de lenguaje pequeño estilo ChatGPT desde cero. La gente lo usa para aprender cómo funcionan los LLM de principio a fin, para probar ideas de entrenamiento de forma barata y para construir un chatbot funcional con un único script.

Contenido relacionado

Explora herramientas, habilidades y artículos relacionados con nanochat.

Alternativas a nanochat

BinkBink

BinkBink

BinkBink · Otro
Selección del editor

BinkBink es una plataforma de juegos online gratuita y un creador de juegos con IA que deja que cualquiera convierta una breve descripción de texto en un juego de navegador jugable. Puedes meterte en cientos de juegos hechos por la comunidad. O describes tu propia idea y la juegas en segundos, y luego la compartes con amigos. ¿Quieres crear tu propio juego? No necesitas programar. Sin configurar un motor, sin descargas, sin complicaciones.

Gratis / $0Ver detalles
Audiogen

Audiogen

Audiogen Inc. · Otro

Audiogen es un generador de música con IA creado por Audiogen Inc., un equipo de investigación pequeño que pasó unos 2,5 años entrenando su propio modelo de música generativa y diseñando una interfaz web a su alrededor. En lugar de un simple cuadro de texto, esta herramienta de música con IA convierte la línea de tiempo en una Estación de Trabajo de Audio Generativo (GAW, por sus siglas en inglés), pensada para principiantes, donde el inpainting, la extensión, la remezcla y la edición de pistas funcionan más como pintar sobre un lienzo. El producto sigue en beta, así que el acceso pasa por una lista de espera o una invitación. Los planes de pago todavía no están publicados.

Gratis / Free (beta)Ver detalles
Aiml API

Aiml API

AIMLAPI OÜ · Otro

Aiml API es una API unificada de modelos de IA que pone más de 1000 modelos de OpenAI, Google, Anthropic y otros detrás de un solo endpoint y una sola factura. Escribes código contra un único esquema compatible con OpenAI y luego cambias entre modelos de chat, imagen, vídeo y audio modificando una cadena de modelo. Encaja con desarrolladores y equipos pequeños que quieren acceso multimodelo sin manejar una docena de cuentas de proveedor distintas, y elimina el dolor de cabeza habitual de la facturación cuando pruebas varios vendedores. Una sola clave lo cubre todo.

Gratis / $0 - $200/moVer detalles