El estancamiento de la IA
La fatiga de la IA
Actualmente hay mucha resistencia a la implementación de la IA por diferentes razones; reemplazo de trabajadores, daños a derechos de autor y propiedad intelectual, imposibilidad de explicar cómo llegan a una decisión, falta de representación (racial, social etc.) en los datos de entrenamiento, los resultados aún se perciben de baja calidad.
Sumado a eso también hay resistencia a la investigación y desarrollo de la IA, como caso notable la oposición a la construcción de centros de datos.
Los inviernos de la IA
Recordando, el término “invierno de la IA” se usa para llamar a los periodos de tiempo en los que el desarrollo de IA se ha detenido, ocurren cuando el tiempo y recursos invertidos en el desarrollo/entrenamiento de IA no producen una mejora en el desempeño.
A continuación una cronología a grandes rasgos de los inviernos de la IA:
1966 Reporte ALPAC - traduccion usando IA resulta más caro y lento que con personas 1969 Perceptron - el perceptron fue considerado inutil por no lograr computar la funcion XOR deteniendo el desarrollo de forma innecesaria por más de 10 años 1971 - 75 frustración de DARPA (Agencia de Proyectos de Investigación Avanzada de Defenza) con las investigaciones de Speech Understanding (computadoras entendiendo dialogo hablado) y recortes para investigación por el mismo organismo 90s - sistemas expertos abandonados
El perceptrón fué uno de los primeros modelos de neurona artificial, una enorme computadora simulando ser una sola neurona, el asunto con su abandono fué un error porque tomaron la incapacidad de un solo perceptron para calcular la funcion XOR (escoger una de dos opciones pero no las dos ni ninguna) siendo que al usar dos capas de perceptrones la función puede ser calculada debido a que la existencia de multiples capas permite que la retropropagación entrena a la red precisamente para poder resolver XOR, así es como funcionan las redes neuronales artificiales.
Los sistemas expertos eran básicamente un programa de computadora con una tabla tipo excel que te ayudaba a encontrar respuestas tipo ¿Este animal es un gato? Siguiendo una serie de preguntas como ¿Tiene pelo? ¿Tiene cola?... eran usados para obtener diagnósticos, predicciones, diseños, planificar pero resultaron muy caros de mantener, difíciles de actualizar, no se podían reentrenar y no eran confiables en situaciones nuevas.
En los últimos años el nuevo boom de la IA comenzó con Deep Learning, precisamente haciendo redes neuronales de varias capas como en el ejemplo del perceptrón, Deep Learning fué lo que nos dió la posibilidad de tener los modelos de lenguaje a los que nos referimos colectivamente como IA
Actualmente hay quienes piensan que nos acercamos a otro invierno de esa IA y se basan en algo que llaman el estancamiento de los LLMs, explicado de la siguiente manera:
Aunque se le llame estancamiento no significa que ya no pueda mejorar, significa que invertir 10 veces más en su entrenamiento no significa mejoras multiplicadas por 10. Estos modelos dependen de grandes cantidades de datos, pero ya los usaron todos (los disponibles en internet), diseñarlos más grandes y más pesados no mejora su desempeño y ultimadamente la forma en que funcionan solo los hace buenos para predecir la siguiente palabra sin razonar, lo que limita su alcance.
Esto no es nuevo, se viene diciendo desde hace un par de años pero no se ha resuelto, para poder entrenar modelos más grandes con nuevos datos Anthropic compra miles de libros para añadirlos a su corpus de entrenamiento, pero para poder procesarlos rápidamente los destruyen en el proceso, otras compañías le apostarán a la generación de datos sintéticos, ambas opciones parecen insostenibles a largo plazo y la primera también moralmente dudosa.
¿Qué se puede hacer para superar el “estancamiento”?
Tres cosas:
1. Mejorar los datos: generar información sintética y verificarla, crear mejores herramientas para el uso de los datos, usar la IA para optimizar el uso de memoria y la eficiencia de la búsqueda
2. Arquitecturas mixtas especializadas: en vez de tener un modelo colosal resolviendo cada tarea usa una arquitectura compuesta por diferentes redes especializadas y darles el tiempo de poner a prueba sus respuestas de diferentes maneras antes de entregarlas
3. Usar la IA para el diseño de la arquitectura y del hardware donde se entrena: Usa un modelo para diseñar el procesador con IA nativa donde puedes entrenar un mejor modelo que puede diseñar un procesador más eficiente…
¿Qué pasaría si no se supera?
No podemos saber con certeza obviamente pero un escenario plausible es el siguiente: La llamada “burbuja de la IA” dejaria de expandirse pero no se reventaría, con este “invierno” en la investigación y desarrollo, la burbuja más bien se congelaría, la inversión se volvería más selectiva, las empresas gigantes de IA no quebrarían pero su valuación se vería afectada por la pérdida de confianza, se tendría que plantear nuevos objetivos pero para las empresas pequeñas significaría una oportunidad, un entorno más estable para la programación de soluciones a la medida con IA experta en tareas específicas afinada in house
¿Y qué pasa si se logra superar?
Las mejoras serían incrementales, puede ser que primero se haga más eficiente energéticamente o el desempeño mejore una fracción, pero al final el resultado es que no podemos esperar que el ambiente de desarrollo de la IA sea estable.
Al principio los más beneficiados serán las grandes compañías, el valor monetario de la inteligencia humana pasaría por un proceso de deflación afectando puestos de trabajo que requieren horas de trabajo intelectual.
Después de un tiempo el costo reducido del cómputo puede permitir que cualquier persona tenga un modelo local en un servidor pequeño, este modelo sería mejor que uno que actualmente necesita infraestructura industrial.
Pasaremos de chatbots a inteligencias que pueden hacer más que generar respuestas, pueden observar, controlar, actuar, sobre ella podrías construir miles de cosas, usarla donde beneficie automáticamente; sensores, robots, laboratorios, fábricas, es decir, en el mundo real.
Conclusión
La IA se encuentra ante dos opciones y no sabemos cuál es la que pasará en el futuro cercano, lo más prudente es prepararse para ambos escenarios, lo que tienen en común es la generación de datos propios, de herramientas que les favorezcan en tareas específicas para aumentar el valor de los procesos o productos que ya tienen y la integración con el mundo físico, eso va a servir en cualquiera de los dos escenarios.