Temas del día

Economía

El costo de la degradación: por qué la industria de la inteligencia artificial busca datos humanos previos a 2023

La saturación de basura algorítmica en la web encendió las alarmas de las tecnológicas. La información real creada por personas reales aumenta su valor.

Eugenio Palopoli

La proliferación masiva de contenidos generados de forma automatizada comenzó a alterar la estructura misma de la web pública y encendió las alarmas en las principales empresas tecnológicas del mundo.

A diferencia del optimismo ciego que dominó la industria tras el lanzamiento de ChatGPT, los laboratorios de desarrollo se chocaron de frente con un límite que pocos anticiparon: la materia prima para entrenar a los sistemas del futuro empezó a envenenarse. La internet abierta, que durante dos décadas funcionó como una cantera infinita y gratuita de lenguaje humano, hoy se encuentra saturada de textos genéricos, resúmenes automatizados y sitios de noticias falsas creados en serie para captar clics. El fenómeno, bautizado en la jerga de Silicon Valley como AI slop o basura algorítmica, dejó de ser un simple incordio para los usuarios y se transformó en una amenaza directa para los propios algoritmos.

Los números que manejan los centros de investigación explican la urgencia. Un informe presentado por el instituto Epoch AI proyectó que el volumen total de texto público de alta calidad —unos 300.000.000.000.000 de palabras acumuladas a lo largo de la historia en libros, artículos, ensayos y código— comenzaría a agotarse de manera efectiva para el entrenamiento entre 2026 y 2032. El ritmo voraz con el que los nuevos modelos absorben información superó por completo la capacidad de la humanidad para producir nuevo conocimiento publicado en la red.

El colapso del modelo y la pérdida de matices

El problema de fondo no es únicamente la escasez de volumen, sino la degradación de la calidad. Cuando un sistema se entrena leyendo textos producidos por otro sistema similar, el lenguaje empieza a perder su riqueza y a reproducir fallas en bucle.

En julio de 2024, un equipo internacional de científicos publicó en la revista Nature un trabajo decisivo sobre este proceso. Encabezado por Ilia Shumailov, investigador del Departamento de Ciencias de la Computación de la Universidad de Oxford, el estudio demostró que la realimentación entre máquinas conduce inevitablemente al "colapso del modelo". Al eliminar los sesgos particulares, la ironía, el humor local y las rarezas del habla real, el software tiende a converger en un promedio insípido e incoherente.

En sus conclusiones, Shumailov fue categórico respecto a esta dinámica: "El aprendizaje indiscriminado a partir de datos producidos por otros modelos causa un proceso degenerativo en el que, con el tiempo, los sistemas olvidan la verdadera distribución subyacente de la realidad".

El proceso equivale a sacar la fotocopia de una fotocopia. En las primeras pasadas la pérdida de nitidez resulta imperceptible, pero al cabo de unas pocas generaciones la imagen se vuelve una mancha ilegible. Para la inteligencia artificial, esa pérdida de nitidez se traduce en alucinaciones más frecuentes, vacíos conceptuales y una incapacidad manifiesta para razonar sobre situaciones poco comunes.

La carrera por el agua potable digital

Frente a este escenario, la industria tecnológica inició un viraje estratégico para aislar sus bases de datos del material producido tras la masificación de las herramientas generativas. El valor comercial de todo lo escrito, grabado o codificado por personas antes de 2023 experimentó una revalorización sin precedentes.

Tamay Besiroglu, investigador asociado en Epoch AI y coautor de los informes sobre la disponibilidad de información, sintetizó la magnitud del cuello de botella técnico: "Si se empiezan a alcanzar los límites de la cantidad de datos disponibles, ya no se pueden escalar los modelos de manera eficiente, y el escalado ha sido el mecanismo más importante para expandir sus capacidades".

Para garantizar la pureza de la materia prima, los grandes jugadores de la industria desplegaron una doble ofensiva. Por un lado, los ingenieros pasaron a priorizar el blindaje temporal mediante el uso de datasets cerrados con fecha de corte en 2022, lo que asegura que ningún párrafo haya sido digerido previamente por un bot. Por otro lado, las compañías pusieron la chequera sobre la mesa y empezaron a negociar acuerdos multimillonarios con dueños de archivos históricos y comunidades que cuentan con una moderación humana activa.

En esa línea, plataformas como OpenAI y Google cerraron contratos por cifras que superan los 60.000.000 de dólares anuales para acceder en tiempo real y de forma exclusiva a las discusiones de foros como Reddit, así como a las hemerotecas de grupos editoriales de primera línea como Financial Times, Axel Springer o News Corp. Lo que buscan no es cantidad de texto, sino la garantía de que detrás de cada oración hay un cerebro humano pensando, argumentando o corrigiendo a otro.

A medida que el agua limpia de la web abierta se vuelve un bien escaso, los laboratorios intentan desarrollar rutas alternativas para sostener el crecimiento de sus herramientas. Una de las vías en las que más recursos se están invirtiendo es la generación de datos sintéticos bajo estricto control. A diferencia del contenido basura que flota en las redes, estos textos e itinerarios lógicos son creados por máquinas pero auditados por especialistas humanos o por programas de verificación matemática antes de integrarse al motor de aprendizaje.

Por otro lado, la atención se trasladó hacia el ámbito privado. Los repositorios de datos corporativos, las historias clínicas anonimizadas, los archivos judiciales y las transcripciones de conferencias académicas representan un océano de información valiosa que jamás llegó a publicarse en internet. Sin embargo, el acceso a este tipo de material choca de frente con regulaciones severas sobre privacidad y propiedad intelectual en casi todo el mundo.

Compartir

Malvinas: el Gobierno evalúa sumar la pesca al régimen de sanciones

Presidencia
  • Ampliación del proyecto de sanciones. En el marco de la Ley de Defensa de la Soberanía Nacional que se enviará al Congreso, la Casa Rosada analiza extender el esquema de sanciones —hoy centrado en las petroleras— a la actividad pesquera vinculada a licencias británicas en Malvinas.
  • Un reclamo que viene del sector. La Fundación Latinoamericana de Sostenibilidad Pesquera y el peronismo piden aplicar a la pesca el mismo criterio que se usa contra las empresas que operan en la exploración de hidrocarburos sin autorización argentina.
  • Una herramienta legal que ya existe. Desde 2008, el artículo 27 bis de la Ley Federal de Pesca exige a quienes tienen cuotas o licencias en el país declarar que no tienen vínculos con buques que pesquen sin permiso argentino en Malvinas, bajo pena de perder esos permisos.
  • El antecedente con las petroleras. Tras la cadena nacional del 3 de septiembre, Cancillería denunció a 60 empresas y personas vinculadas a proyectos petroleros como Sea Lion, alcanzando también a accionistas, directores y proveedores.
  • Presentación en Diputados. El proyecto ingresará el próximo lunes por la Cámara baja, con Presti (Defensa) y Quirno (Cancillería) como posibles expositores; el oficialismo espera que el tratamiento comience entre fines de septiembre y principios de octubre.

Marc Jacobs, Michael Kors y otras marcas desembarcan en el nuevo shopping OH! Buenos Aires

  • Nuevo centro comercial en Recoleta. Prevé abrir sus puertas en los próximos meses en el predio del ex Buenos Aires Design, contando con 30.000 metros cuadrados, 110 locales y 30 propuestas gastronómicas.

  • Llegada de etiquetas inéditas al país. Firmas internacionales como Stella McCartney, Off-White, Golden Goose, Palm Angels, Scotch & Soda, Dsquared2 y Mandarina Duck tendrán por primera vez locales en la Argentina.

  • Moda automotriz y un esperado regreso. Maserati estrenará un espacio exclusivo destinado a su línea de indumentaria y accesorios, mientras que la firma francesa de trajes de baño Vilebrequin volverá a operar en el país.

  • Impulso importador y capitales nacionales. La llegada de estas grandes marcas globales se da en el marco de la reciente apertura de importaciones, dentro de un proyecto financiado por el grupo argentino Hatzlaja.