18/8/26

Generación automática de poesía: tendencias y situación

 


El artículo Computational Approaches to Automatic Poetry Generation and Evaluation: A Survey, de Koziev y  Sinev, ofrece una revisión exhaustiva de las investigaciones más recientes sobre la generación automática de poesía mediante inteligencia artificial y los métodos utilizados para evaluar la calidad de los poemas generados. Los autores se centran especialmente en los criterios de evaluación de la diversidad, la creatividad, la naturalidad y la valoración humana de los textos poéticos producidos por modelos computacionales. Se trata de un amplio estudio con más de 70 páginas, incluyendo bibliografía.

Un hecho evidente es que mientras que hasta hace 4 o 5 años, las técnicas más usadas para generar poesía digital se basaban en patrones (como en Poetrónica o Poetrónica 2), a partir del 2022 casi todos los avances se dan con el uso de los LLMs.


En primer lugar, se aborda la diversidad lingüística, entendida como un indicador de riqueza expresiva y ausencia de redundancia. Para medirla, se emplean diversas métricas de diversidad léxica desarrolladas en lingüística computacional, como MTLD, TTR, MATTR, HD-D o la proporción de hápax legómenon, que permiten estimar la amplitud y variedad del vocabulario utilizado. Además, los estudios sobre poesía generativa suelen calcular la diversidad mediante la proporción de n-gramas únicos o mediante medidas de similitud entre poemas generados, utilizando herramientas como la similitud de Jaccard, el coeficiente Dice-Sørensen, BLEU o BERTScore. 

Sin embargo, los autores señalan que la diversidad no debería limitarse únicamente al nivel léxico, sino que también debería incluir aspectos sintácticos y estilísticos, lo que constituye una línea de investigación todavía abierta. 

A continuación, el artículo examina el complejo problema de la evaluación de la creatividad. Los autores destacan que no existe una definición universalmente aceptada de creatividad, lo que dificulta enormemente su medición objetiva. Algunas investigaciones la relacionan con la originalidad y la ausencia de plagio, mientras que otras incorporan elementos como la imprevisibilidad, el valor artístico o la capacidad de suscitar interés en lectores y críticos. 

Se revisan diversos marcos teóricos procedentes del campo de la creatividad computacional, como el modelo de las Cuatro P de Rhodes (Persona, Proceso, Presión y Producto), la metodología SPECS o el marco Creative Tripod, que intentan estructurar la evaluación de sistemas creativos. En la práctica, muchos trabajos reducen la creatividad a indicadores más simples, como la novedad respecto a los datos de entrenamiento o la capacidad de provocar emociones. 

También se analiza el problema de la memorización en los modelos de lenguaje, que pueden reproducir fragmentos completos de poemas existentes, por lo que se han desarrollado métricas de plagio y técnicas para reducir este fenómeno durante el entrenamiento. Asimismo, se presentan enfoques más innovadores, como el cálculo de una “dirección de creatividad” en el espacio interno de representaciones de los modelos de lenguaje para medir e incluso aumentar la creatividad de los textos generados. 

Otro aspecto importante tratado es la naturalidad de los poemas generados, es decir, su capacidad para parecer escritos por seres humanos. La evaluación de esta propiedad puede realizarse mediante juicios humanos o mediante algoritmos de detección de textos generados por inteligencia artificial. 

Los autores revisan estudios que analizan características como la cohesión semántica de los tokens, la topología de los mapas de atención en modelos neuronales o métricas estadísticas como MAUVE, diseñada para medir la distancia entre distribuciones de textos humanos y artificiales. No obstante, se reconoce que estas herramientas todavía presentan limitaciones y que su correlación con las valoraciones humanas no siempre es satisfactoria. 

El artículo dedica además una sección extensa a la evaluación humana, considerada todavía el estándar de referencia para juzgar la calidad poética. Se describen los principales criterios utilizados por los evaluadores, entre ellos la rima, el ritmo, la corrección gramatical, la fluidez, la originalidad, la creatividad, la capacidad evocadora, la diversidad, la naturalidad, la adecuación al tema, la fidelidad en traducciones poéticas, el estilo y la calidad general. Los autores señalan que los protocolos de evaluación humana varían considerablemente entre estudios y que muchas investigaciones no informan adecuadamente sobre el grado de acuerdo entre evaluadores, lo que dificulta la comparación de resultados. También se discuten los efectos de la experiencia de los evaluadores, observándose que los expertos en poesía suelen ser más exigentes que los participantes no especializados. En varios estudios de tipo “test de Turing”, los participantes tienen dificultades para distinguir entre poemas escritos por humanos y poemas generados por inteligencia artificial, especialmente cuando se seleccionan cuidadosamente las mejores producciones de los modelos. 

Finalmente, el artículo analiza la relación entre las métricas automáticas y las evaluaciones humanas. Los autores destacan el creciente interés por utilizar grandes modelos de lenguaje como jueces automáticos capaces de reproducir valoraciones humanas. Aunque algunos estudios muestran correlaciones prometedoras entre las puntuaciones otorgadas por modelos como GPT-4 o Claude y las evaluaciones humanas, los resultados siguen siendo variables según la característica poética evaluada. 

A modo de conclusión, el trabajo identifica varias tendencias importantes en la investigación reciente, como el dominio de los modelos basados en transformadores, el uso creciente de grandes modelos de lenguaje tanto para generar como para evaluar poesía y la falta de protocolos estandarizados de evaluación. También señala importantes desafíos pendientes, entre ellos la necesidad de mejores métricas para creatividad y calidad poética, la escasez de corpus de alta calidad en muchos idiomas, el estudio de estrategias de generación más avanzadas y la integración de enfoques como la generación aumentada por recuperación de información, los sistemas multiagente y las técnicas de razonamiento paso a paso. Todo ello sitúa la generación automática de poesía como un campo de investigación en rápida evolución que combina procesamiento del lenguaje natural, creatividad computacional y evaluación artística.



0 comentarios :