Inteligencia Artificial
22 de octubre de 2025
La importancia de la organización de los datos en la era de la IA
Porque la calidad y el contexto de los datos son un factor diferencial competitivo en la era de la IA

Hoy, la inteligencia artificial ocupa el centro de las conversaciones estratégicas en las organizaciones. Más que una percepción individual, su presencia constante en eventos, capacitaciones y reuniones corporativas está confirmada por datos. El Artificial Intelligence Index Report 2025, publicado por la Universidad de Stanford —considerado el informe más confiable y completo sobre IA en el mundo— confirma el aumento expresivo de la relevancia del tema. En su 8ª edición, el documento muestra que la adopción de la tecnología creció de forma acelerada, y las inversiones privadas superaron la marca de 252 mil millones de dólares a nivel mundial. La inteligencia artificial dejó de ser un recurso experimental para convertirse en parte estructural de las decisiones, de los productos y de las estrategias.
Este avance es evidente en el siguiente gráfico, que muestra que el 78% de las organizaciones ya utilizan IA en al menos una función, mientras que el 71% ha adoptado soluciones de IA generativa. El salto entre 2023 y 2024 evidencia la aceleración de la adopción de estas tecnologías, que, además de automatizar procesos, ahora interactúan de forma natural y crean.

Fuente: Encuesta de McKinsey & Company, 2024.
A pesar de la popularidad del tema, muchas empresas aún no están preparando sus entornos internos para extraer lo mejor de la tecnología. Mirar a este escenario con pragmatismo, invirtiendo en estructura, organización y claridad sobre los datos que alimentan los modelos, puede representar un diferencial competitivo real en los próximos años. Es esencial desarrollar alfabetización en IA: comprender los fundamentos de la tecnología para participar de las decisiones con criticidad. Este texto no busca cubrir todos los aspectos de la inteligencia artificial, sino que se concentra en una etapa muchas veces descuidada: la calidad de los inputs, especialmente de los datos.
De forma simplificada, los modelos de IA son algoritmos estadísticos que procesan probabilidades basándose en grandes volúmenes de datos. En el caso de los LLM (Large Language Models), como los que están detrás de herramientas populares como ChatGPT o Gemini, estamos hablando de miles de millones — o incluso billones — de parámetros alimentados por bases masivas. Comprender esta escala es desafiante: un modelo de 8 mil millones de parámetros se considera pequeño, mientras que DeepSeek, con 80 mil millones, ya se clasifica como grande (y hay modelos mucho más grandes).
Pero modelos más grandes no significan necesariamente modelos mejores. El tamaño está ligado a la capacidad de cubrir más contextos, no a la calidad intrínseca de las respuestas. Un modelo entrenado con miles de millones de datos puede saber tanto sobre recetas como sobre programación, pero eso no garantiza precisión en cada dominio. Es justamente ahí donde reside tanto el potencial como el desafío: la calidad de los datos utilizados define, en última instancia, la calidad de las respuestas que estos modelos son capaces de entregar.
Imagine entrenar un modelo solo con datos de gastronomía, dejando fuera información sobre programación. Puede volverse extremadamente preciso en recetas, pero incapaz de responder sobre códigos y viceversa. Esta selectividad revela lo que se vuelve cada vez más relevante: modelos alimentados con datos contextualizados, curados y estructurados.

Gran parte de las llamadas “alucinaciones” generadas por modelos ocurre justamente por la influencia directa de los inputs en el resultado. Sam Altman, CEO de OpenAI, afirmó recientemente: “La gente tiene un grado muy alto de confianza en ChatGPT, lo cual es interesante, porque la IA tiene alucinaciones. Debería ser la tecnología en la que menos confías.” La confianza excesiva, sumada a la baja comprensión sobre el funcionamiento de los modelos, aumenta el riesgo de errores estratégicos y decisiones basadas en respuestas superficiales.
Se habla mucho de ingeniería de prompts — la disciplina de formular comandos de texto para obtener respuestas más asertivas. Pero, antes del prompt, es la calidad y la preparación de los datos lo que determina la eficiencia del modelo. Es en este contexto que ganan fuerza los SLM (Small Language Models), modelos más pequeños y específicos, entrenados con bases segmentadas. En lugar de intentar cubrir todos los contextos, están diseñados para actuar con profundidad en dominios delimitados.
Lucas de Oliveira y Felipe Silva, especialistas en tecnología y machine learning, destacan que, además de presentar mayor precisión, estos modelos también son energéticamente más eficientes. Un ejemplo es el Phi-3-mini, un modelo de 3.800 millones de parámetros que alcanzó un rendimiento equivalente al PaLM (540B) en pruebas de MMLU, un salto de eficiencia de 142 veces.
Sin embargo, utilizar modelos genéricos, sin entrenamiento contextual o base propietaria, aumenta el riesgo de resultados inconsistentes e incluso de exposición de información sensible. El simple acto de enviar archivos, hojas de cálculo o textos confidenciales a herramientas públicas de IA ya representa un riesgo a la privacidad y a la seguridad de los datos, ya que esta información puede ser incorporada a los procesos de entrenamiento de grandes modelos.
Hablo sobre la importancia de la alfabetización en IA porque, cuando abordamos el tema, surgen diferentes capas de discusión. Un término recurrente en estas conversaciones es el tuning — o, de forma simplificada, el entrenamiento de modelos. Este proceso consiste en proporcionar datos para que el modelo aprenda y se adapte a determinado contexto. La cantidad y la calidad de esta información influyen directamente en el resultado: es posible ofrecer un volumen reducido de datos y obtener un modelo pequeño y especializado, o trabajar con una masa gigantesca y crear modelos amplios y generalistas. En esencia, el entrenamiento es la forma de organizar y dirigir el comportamiento de un modelo para un contexto específico — como el ejemplo citado de la IA especialista en gastronomía y sin contexto de programación.
Cada organización posee datos únicos sobre sus operaciones, clientes y mercados. Tratar esta información de forma sistemática — organizándola de modo estructurado y estandarizado — crea un conjunto de datos equilibrados que facilitan estrategias de uso, ya sea en modelos estadísticos tradicionales, ya sea en algoritmos de predicción e inteligencias artificiales orientadas a la creación de escenarios y planes estratégicos.
Estos conjuntos de datos estructurados se denominan datasets: colecciones organizadas de información listas para el análisis. A partir de datasets internos, es posible construir soluciones capaces de actuar como agentes de apoyo contextualizados, alineados a la realidad y al lenguaje de cada negocio. Más que una inversión técnica, se trata de un cambio cultural: preparar personas, procesos y flujos para lidiar con datos de manera estratégica y consciente.
En este sentido, documentar bien nunca ha sido tan importante. Registros de reuniones, actas, trazabilidad de tareas y estandarización de procesos forman una base de conocimiento que, en el futuro, puede alimentar modelos internos de IA con contexto y precisión. Las organizaciones que ya poseían esta cultura tienen ventaja: sus datos están más igualados y, por lo tanto, pueden ser utilizados. Aquellas que no mantenían este cuidado necesitan actuar ahora —aunque sea de forma reactiva—, creando el hábito de registrar y organizar desde ya. La buena noticia es que las propias herramientas de IA pueden ayudar en este proceso.
Las plataformas de videoconferencia ya ofrecen recursos de transcripción automática; los modelos generativos ayudan a aplicar patrones en anotaciones e informes; y otras herramientas son capaces de resumir grandes volúmenes de información. El uso de estas IA auxilia en la preparación de datasets para el entrenamiento de nuevos modelos — o simplemente proporciona contexto adicional para prompts, aumentando la exactitud de los resultados.
Los modelos predictivos, cuando están bien estructurados, ayudan a anticipar riesgos y oportunidades. Pero para que esto ocurra, se necesita algo aún más fundamental: buenos inputs y personas con conocimientos de IA. Trabajar en un mundo post-IA generativa no se trata solo de crear buenos prompts o dominar herramientas. Se trata de entender que los modelos reflejan los datos que reciben: si la entrada es confusa, sesgada o desorganizada, la salida también lo será. En esencia, la inteligencia artificial es una tecnología de traducción de información, y su uso exige responsabilidad y sentido crítico sobre los datos que alimentan el sistema.
Por eso, organizar la información de forma consciente, estructurada y ética es quizás el mayor desafío — y la mayor ventaja competitiva — de las organizaciones en los próximos años. La asertividad de los modelos nace de la calidad de los inputs. Y la madurez digital se medirá, cada vez más, por la capacidad de comprender, proteger y valorar los propios datos. Los datos abiertos y externos están disponibles para todos, pero los que las organizaciones generan y tienen el privilegio de acceder serán su verdadero diferencial. Un dato puede existir, pero solo se vuelve valioso cuando está organizado y listo para ser procesado.
| Para tener acceso a las referencias de este texto haga clic aquí. |
Quién publicó esta columna
Lucas Tangi








