Hraness
Theme
Appearance

preentrenamiento mediante autojuego con cero datos

Self-Play Pretraining with Zero Data

arXiv · Aditya Cowsik, Kfir Dolev, Michael Y. Li, G. Bruno De Luca, Nourya Cohen, Noah D. Goodman, Yoav Levine · 24 de septiembre de 2026

by Hraness · drafted with ai assistance

en síntesis

Cowsik, Dolev, Li y sus coautores muestran que el autojuego sobre una máquina de Turing universal puede preentrenar con cero datos naturales y con una escala zero-shot predecible. Un generador propone programas similares a Brainfuck cuyas salidas en bytes entrenan a un aprendiz por predicción del siguiente token, mientras el aprendizaje por refuerzo recompensa los programas situados en la frontera del aprendiz. En texto, imágenes, audio, música, ADN y código, las fronteras óptimas de cómputo siguen leyes de potencia con exponentes comparables al preentrenamiento ordinario; el aprendiz también desarrolla aprendizaje en contexto. Los autores lo presentan como una forma de generar estructura predictiva universal, no como un sustituto de los hechos contingentes del mundo.

ideas

  • Dos modelos coevolucionan desde pesos aleatorios. Un generador propone programas similares a Brainfuck para una máquina de Turing universal; un aprendiz se entrena sobre las secuencias de bytes emitidas por predicción del siguiente token.
  • La recompensa por progreso de aprendizaje supera a la dificultad en bruto. El generador se refuerza cuando los gradientes del aprendiz se alinean con el movimiento reciente de los parámetros, evitando programas difíciles solo porque inyectan ruido.
  • La pérdida zero-shot escala como una ley de potencia en cómputo. En texto, imágenes, audio, música, ADN y código, las fronteras óptimas de cómputo mejoran sin ningún paso de gradiente sobre datos naturales.
  • La búsqueda adaptativa supera a un prior universal fijo. Muestrear el mismo espacio de programas sin adaptar el currículo escala mucho más lento; el autojuego también descubre secuencias de Fibonacci, geométricas y polinómicas mucho antes.
  • La estructura universal no es conocimiento contingente. Los autores tratan el método como generación de regularidades predictivas transferibles y como un arranque en caliente que acelera el preentrenamiento posterior con datos naturales, no como un reemplazo de los hechos específicos del mundo.

citas de la fuente

“Across several natural datasets, zero-shot loss exhibits predictable scaling in compute.”

Cowsik, Dolev, Li y coautores, resumen

“access to a universal program space alone is not enough—self-play must learn where in that space to allocate training compute.”

Cowsik, Dolev, Li y coautores, en comparación con un prior fijo

“we do not view universal pretraining as a replacement for natural data”

Cowsik, Dolev, Li y coautores, discusión

página original (en inglés)