29/9/26

Generación autorregresiva. Modelo reverberante

 


El artículo Autoregressive Generation and Data Scaling Without Attention, cuyo autor principal es George Fountzoulas, de la Frederick University de Chipre, constituye el tercer trabajo de la serie Kathleen. 

Los dos artículos anteriores demostraron que una arquitectura a nivel de bytes, sin atención y sin tokenizador, basada en un codificador de tipo wavetable y un estado reverberante multi-escala, podía igualar o superar a sistemas mucho más grandes en tareas de clasificación, y eso sólo con apenas 450-700 mil parámetros y sin preentrenamiento.

La pregunta pendiente era si ese mismo concepto podía generar texto. 

En este artículo se aborda si un modelo pequeño, libre de atención y operable offline, trabajando con hardware de bajo coste (como una GPU T4 gratuita de Kaggle) es capaz de modelar lenguaje a nivel de bytes y de producir texto que “se lea como texto humano”. Asimismo, se mide la calidad formal de la generación, determinando qué factores (arquitectura, política de decodificación o recuperación de frases) realmente impulsan las mejoras.

La metodología se articula sobre tres ejes. En primer lugar, se realiza un estudio de escalado de datos sobre WikiText-103 tratados como bytes UTF-8 básicos, sin tokenizador. Se entrenan modelos de aproximadamente 0,5 millones de parámetros (este reverberante y un transformer de tamaño comparable) sobre conjuntos de 2, 8, 32, 128 y 512 MB, con secuencias de 256 bytes y procedimiento idéntico. 

Aplicando este método se miden bits por byte en un conjunto de prueba fijo de 1 MB. Se replican los resultados con una segunda semilla y se valida la robustez en el corpus enwik8. Además, se evalúa la transferencia mediante con pruebas como SST-2 e IMDB. En segundo lugar, se introduce FORM DISTANCE, un instrumento no paramétrico y resistente a la manipulación que mide si el texto generado “se lee como texto”. Nueve parámetros (riqueza léxica, diversidad de trigramas, persistencia temática, continuidad semántica local, novedad tardía, plausibilidad de bigramas, desarrollo semántico, tasa de bigramas y trigramas no vistos) definen una nube de referencia a partir de 400 párrafos humanos de WikiText. El sistema se valida rechazando cinco falsos resultados (sopa de palabras, efecto loro, dron, mezcla y balbuceo de trigramas). 

En tercer lugar, se estudia la generación sobre un modelo con 3 millones de parámetros entrenado en WikiText-2. Se añaden una docena de políticas de muestreo (top-k y temperatura) y se introduce un esquema de decodificación por recuperación de frases del propio corpus.  

Las conclusiones principales parecen claras. En el régimen de pocos parámetros y datos, de megabytes a centenares de megabytes, el modelo reverberante supera al transformer. En términos de eficiencia de datos, el transformer necesita más de 512 MB para igualar lo que el modelo sin atención aprende con 32 MB. Ambas curvas se aplanan hacia el mismo techo de capacidad, y la pendiente más pronunciada del transformer refleja simplemente que parte desde más atrás. 

El preentrenamiento a nivel de bytes inyecta información de sentimiento en las representaciones congeladas, y el sistemala  reverberante transfiere mejor. 

Respecto a la generación de texto propiamente dicha, la política de decodificación resulta más importante que la arquitectura: ampliar el muestreo (top-1000, temperatura 1,15) reduce la distancia FORM de 3,17 a 1,52. La recuperación de frases del propio corpus se reduce aún más hasta 1,14, sin ningún paso de entrenamiento adicional; el beneficio proviene de la dosis de frases y no de la puerta de selección. 

Para un resultado óptimo las frases deben provenir del corpus de entrenamiento del modelo: una biblioteca extranjera, incluso cuarenta veces mayor, no ayuda, fenómeno que comparte el gemelo de atención y que se atribuye a la ausencia de integración contextual a esta escala. 

Otras mejoras arquitectónicas probadas no aportaron mejoras.

Todo el trabajo es reproducible offline en hardware gratuito. El autor señala como caminos futuros, el escalado conjunto de parámetros y datos, la memoria holográfica explícita para el recuerdo exacto a largo plazo y la extensión a señales nativas más allá del texto.

Puede leerse completo en este enlace.



0 comentarios :