Contratar IAAuditoría de IANivel: dirección / operaciones

Qué revisa una auditoría de IA, punto por punto

La mayoría de informes de auditoría que he visto empiezan por el modelo. Qué proveedor, qué versión, qué parámetros. Es la parte más fácil de escribir y la que menos cambia una decisión de negocio.

Lo que de verdad decide si un sistema de IA se queda, se ajusta o se apaga está en otras cinco capas, y ninguna de ellas es técnica del todo.

Definición

Una auditoría de IA revisa cinco cosas: qué decide el sistema, con qué datos, con qué permisos, cuánto cuesta sostenerlo y quién responde cuando falla.

1234layersLas cinco capas, en orden
Se sube un escalón a la vez. Saltarse uno se paga después.

Por qué el orden importa

Las cinco capas se revisan en un orden concreto porque cada una necesita la respuesta de la anterior.

Definición

Una auditoría de IA revisa cinco cosas: qué decide el sistema, con qué datos, con qué permisos, cuánto cuesta sostenerlo y quién responde cuando falla.

Mirar el costo antes de saber qué decide el sistema es leer una factura sin saber qué compraste. Y mirar los permisos sin saber a qué datos accede es revisar una llave sin saber qué puerta abre.

Hay una razón práctica además de la lógica. Cada capa que se revisa produce preguntas para la siguiente, y hacer esas preguntas en la reunión equivocada obliga a volver.

Saber que el sistema decide solo el descuento hasta cierto monto cambia qué se le pregunta a finanzas sobre el costo. Y saber a qué datos accede cambia qué se le pregunta al área de sistemas sobre los permisos.

Hecho en orden, una auditoría de un sistema son tres o cuatro conversaciones. Hecho en desorden, son las mismas conversaciones repetidas dos veces.

1 · Qué decide el sistema

Se pide por escrito, en una tabla de tres columnas: qué hace solo, qué propone para que alguien apruebe y qué manda directamente a una persona.

Casi nunca existe ese documento. Y el hecho de que no exista ya es el primer hallazgo, porque significa que el límite de autonomía nunca se decidió: se fue quedando.

Las preguntas que lo destapan:

  • ¿Qué es lo más caro que este sistema podría hacer sin que nadie lo apruebe?
  • ¿Cuándo fue la última vez que alguien revisó una muestra de lo que respondió?
  • Si mañana empieza a equivocarse en el 10 % de los casos, ¿cómo nos enteraríamos?

Si la tercera no tiene respuesta, el sistema es un bucle abierto: ejecuta y nadie comprueba.

Hay una forma rápida de levantar esa tabla cuando no existe, y es preguntarle al sistema mismo.

Se toman veinte casos de la última semana y se clasifican a mano en las tres columnas. En veinte casos ya se ve si el límite de autonomía que la empresa cree tener es el que está operando.

La sorpresa habitual no es que el sistema haga de más. Es que haga de menos: manda a revisión humana casos que podría cerrar solo, y esa revisión se ha convertido en una cola que nadie mira.

Mi criterio

Un sistema que escala demasiado a una persona parece prudente y en realidad es un sistema que no terminó de configurarse. Cuesta lo mismo que uno bien ajustado y devuelve la mitad, con el agravante de que genera trabajo manual nuevo en vez de quitarlo.

2 · Con qué datos trabaja

Aquí se revisa el recorrido completo del dato, no su calidad en abstracto.

  • De dónde sale. Qué sistema es la fuente y si esa fuente es la que la empresa considera oficial.
  • Quién lo actualiza y cada cuánto. Un dato que se cargó una vez y nadie refrescó envejece sin avisar.
  • Qué pasa cuando falta. Si el sistema improvisa en vez de detenerse, cada hueco se convierte en una respuesta inventada.
  • Qué información de la empresa sale hacia el proveedor, que es una pregunta de riesgo y está desarrollada en si los datos de tu empresa entrenan la IA.
Mi criterio

El 80 % de los hallazgos que parecen de modelo son de dato. El sistema responde mal porque la información que recibe está desactualizada, incompleta o viene de la fuente equivocada. Cambiar de modelo no arregla nada de eso, y sin embargo es lo primero que propone casi todo el mundo.

Hay un quinto punto que se revisa aparte porque no es del dato sino de quién lo mira: si alguien compara lo que el sistema dijo con lo que pasó después.

Un sistema que estima demanda, prioriza leads o clasifica incidencias produce una predicción que la realidad confirma o desmiente días después. Si nadie hace esa comparación, el sistema puede llevar meses desviándose sin que aparezca en ningún sitio.

Es el mecanismo que en el glosario está descrito como deriva de modelo, y es de los hallazgos que más caro salen porque no duelen hasta que ya llevan tiempo.

3 · Con qué permisos está conectado

Es la capa donde aparecen los sustos, y casi siempre por la misma razón: se conectó con la cuenta que estaba a mano el día de la instalación.

Lo que suele haberLo que debería haber

Una cuenta de administrador compartida.

Una cuenta propia del sistema, con nombre.

Acceso de escritura a todo el CRM.

Escritura solo en los campos que necesita.

Credenciales en el código o en un chat.

Credenciales en un gestor, rotadas.

Nadie sabe qué puede tocar.

Un inventario de permisos revisado cada trimestre.

El criterio de fondo está en qué permisos debe tener un agente de IA, y aplica igual a un sistema que no sea un agente.

La prueba concreta que se hace en esta capa cabe en una pregunta: si alguien tomara control de este sistema ahora mismo, ¿qué es lo peor que podría hacer con los permisos que ya tiene?

No hace falta un ejercicio de seguridad sofisticado para responderla. Basta con listar a qué sistemas está conectado y con qué nivel de acceso, y leer la lista en voz alta en la reunión.

En la mitad de los casos alguien de la sala dice «¿eso puede hacer qué?», y ahí termina la parte difícil de convencer de que había que auditar.

4 · Cuánto cuesta sostenerlo de verdad

La factura visible casi nunca es el costo. El total se arma sumando cinco líneas, y tres suelen faltar en la propuesta original.

  • Licencias y suscripciones. La única que todos ven.
  • Consumo por uso. Crece con la adopción, que es justo lo que la empresa quería. Sin tope ni alerta, sorprende.
  • Mantenimiento. Lo que cuesta que alguien revise, ajuste y arregle. Está en cuánto cuesta mantener un agente de IA.
  • Horas internas. El tiempo de la gente de la empresa que lo cuida, que no aparece en ninguna factura.
  • Costo de salida. Qué costaría cambiar de proveedor. Es el que nadie calcula hasta que hace falta.

Sobre el costo de salida, que es la línea que casi nadie calcula: no es un ejercicio teórico, se estima con tres preguntas.

  • ¿Dónde vive el histórico de conversaciones o decisiones, y se puede exportar?
  • ¿La configuración del sistema está escrita en algún sitio o vive dentro de la herramienta del proveedor?
  • ¿Cuánto tardaría el equipo en volver al proceso anterior si esto se apagara mañana?

Si la tercera no tiene respuesta, la empresa no depende de una herramienta: depende de un proveedor. Es lo que el glosario llama vendor lock-in.

5 · Calidad de respuesta, medida y no opinada

«Funciona bien» no es un dato. Lo que se hace es tomar una muestra de casos reales y revisarlos uno por uno contra un criterio escrito antes de mirar.

Con 50 o 100 casos ya se ve el patrón. Y lo que se busca no es el porcentaje de aciertos, sino dónde falla:

  • Si los errores se reparten al azar, es ruido del modelo y se vive con ello.
  • Si se concentran en un tipo de caso, hay un hueco de dato o de instrucción, y eso se arregla.
  • Si el sistema responde con seguridad cosas falsas, el problema es de diseño y no de precisión.

El criterio escrito antes de mirar es la parte que más se salta y la que hace que la revisión sirva.

Sin criterio previo, quien revisa termina puntuando por sensación, y la sensación cambia según el caso que acaba de leer. Con criterio previo, dos personas distintas revisando la misma muestra llegan a números parecidos.

Un criterio suficiente cabe en tres líneas: qué cuenta como respuesta correcta, qué cuenta como aceptable pero mejorable y qué cuenta como error. Escrito antes, no después.

6 · Quién responde cuando falla

La última capa es la más corta de revisar y la que más predice el futuro del sistema. Se pregunta un nombre.

Si la respuesta es «el proveedor», falta la mitad. El proveedor responde por que el sistema funcione; alguien de la empresa tiene que responder por que el número mejore. Son dos responsabilidades distintas y se confunden todo el tiempo.

Ese rol interno tiene nombre y está descrito en qué es un Champion de IA.

Hay una pregunta de control que resuelve esta capa en treinta segundos: si el sistema empieza a dar respuestas equivocadas un martes por la mañana, ¿a quién le suena el teléfono?

Si la respuesta tarda en llegar o incluye la palabra «depende», el sistema está huérfano aunque tenga contrato de soporte vigente.

Qué se revisa de la documentación

No se audita si la documentación es bonita. Se audita si describe el sistema que está funcionando hoy.

La prueba es rápida: se toma una decisión que el sistema tomó esta semana y se busca en el documento por qué la tomó. Si no está, la documentación describe otra versión.

Lo que sí tiene que estar está en cómo se documenta una arquitectura de IA.

Con qué sale el comité

El entregable útil de las seis capas cabe en una página.

  1. 01

    El veredicto, en una línea: continuar, ajustar o cortar.

  2. 02

    Los tres hallazgos que cuestan dinero, ordenados por cuánto.

  3. 03

    El costo real mensual, con las cinco líneas sumadas.

  4. 04

    El plan de corrección, con dueño y fecha por hallazgo.

  5. 05

    La fecha de la próxima revisión y el número que tiene que haberse movido.

Todo lo demás es anexo. Si el comité necesita leer cuarenta páginas para decidir, la auditoría no terminó su trabajo.

Un detalle de forma que cambia cómo se recibe el informe: los hallazgos se escriben en el idioma del negocio y no en el del sistema.

Preguntas frecuentes

¿Se puede auditar sin acceso a los datos reales?

Se puede, pero el resultado es mucho más débil. Sin ver casos reales solo se audita lo que la documentación dice que pasa, no lo que pasa. Si el acceso no es posible por confidencialidad, el mínimo aceptable es una muestra anonimizada y las estadísticas de error del propio sistema.

¿Cuántos casos hay que revisar para que la muestra sirva?

Entre 50 y 100 casos reales suele bastar para ver el patrón, que es lo que interesa. No se busca precisión estadística: se busca dónde se concentran los errores. Si con 50 casos no aparece ningún patrón, los errores son ruido y el sistema está razonablemente sano.

¿Qué pasa si el proveedor no quiere dar acceso a los registros?

Es un hallazgo en sí mismo, y de los graves. Un proveedor que opera un sistema en tu empresa y no te deja ver qué hizo te está pidiendo confianza sin evidencia. Conviene revisar qué dice el contrato al respecto antes de la siguiente renovación.

¿La auditoría revisa también si el modelo cumple normativa?

Revisa el encaje básico: qué datos personales entran, dónde se almacenan y si hay decisiones automatizadas que afecten a personas. El dictamen legal no lo da una auditoría técnica; lo que sí hace es levantar las banderas para que alguien con criterio legal las mire.

¿Con qué frecuencia conviene repetirla?

Una vez al año para un sistema estable, y siempre antes de renovar el contrato o de escalar a otra área. Si el sistema cambia seguido, tiene más sentido una revisión trimestral corta de las capas de costo y calidad que una auditoría completa anual.

Fuentes

Este artículo sintetiza y pone en contexto de negocio material público de estas fuentes. Léelas directo; aquí solo se agrega criterio de implementación.

  1. El NIST AI Risk Management Framework detalla en su función Measure qué se mide de un sistema de IA en operación y con qué evidencia, que es la base de las capas 4 y 5 de esta guía. nist.gov/itl/ai-risk-management-framework
  2. IBM documenta las prácticas de gobierno de IA que sostienen la trazabilidad de decisiones automatizadas, que es lo que hace auditable un sistema en producción. ibm.com/topics/ai-governance
  3. Anthropic describe en su guía de agentes por qué el límite de autonomía y los permisos son decisiones de diseño y no ajustes posteriores, que es el criterio de las capas 1 y 3. anthropic.com/engineering

Sigue explorando

El siguiente paso

No son artículos relacionados al azar: es el orden en el que esto se entiende y se aplica.

Estás aquí

Contratar IA · Qué revisa una auditoría de IA, punto por punto

Cómo contratar IA sin comprar humo · Playbook AI Native

José Andonaire

Sobre el autor

José Andonaire

Ayudo a empresas de Latinoamérica y España a identificar, priorizar e implementar oportunidades de inteligencia artificial que generen resultados reales para el negocio. Lo que publico sale de implementaciones reales, no de teoría.