Agentes gestionadosElección de proveedorNivel: dirección / compras

Cómo elegir un proveedor de agentes de IA gestionados

Firman el contrato después de una demo perfecta: el agente responde rápido, suena natural y resuelve el caso de prueba en segundos frente a todo el comité. Tres meses después nadie en la empresa puede decir con un número si el agente mejoró algo. El tiempo de respuesta no bajó de forma medible, las conversaciones que terminan escaladas a un humano siguen casi iguales que antes, y cuando alguien pregunta qué pasó, el proveedor contesta que “se está optimizando”. No hay un número de antes y no hay un número de ahora, así que la conversación se convierte en una opinión contra otra, y el que tiene más poder en esa discusión siempre es el proveedor, porque él controla los datos. Ese es el primer filtro real, y casi nadie lo aplica en la reunión de venta: si el proveedor no puede comprometerse con una cifra de referencia auditable antes de firmar, no está vendiendo un servicio gestionado. Está vendiendo su tiempo, disfrazado de tecnología.

Definición

El proveedor de agentes de IA correcto se distingue por lo que se compromete a medir, no por la demo. El que no acepta un número de referencia no vende operación: vende horas.

1234FILTROLas diez preguntas de filtro
Se sube un escalón a la vez. Saltarse uno se paga después.

El agente funciona en la demo. El problema aparece a los noventa días

El patrón se repite con una regularidad incómoda. Un equipo comercial de agentes de IA hace una demo impecable con datos curados, el flujo cubre exactamente el caso que se mostró y el comité de compra sale convencido. Nadie en esa sala pregunta qué pasa cuando un cliente escribe algo que el flujo no anticipó, o cuántas conversaciones al mes va a manejar el agente en la vida real contra las quince que se probaron en la demo. La empresa firma pensando que compró un servicio gestionado de agentes de IA, y en la práctica compró una configuración inicial y una promesa verbal de que “el equipo del proveedor está encima”.

El problema no aparece el primer día, aparece cuando el volumen sube o cuando entra un caso raro que nadie configuró. El agente responde mal, o peor, responde con seguridad algo incorrecto, y el cliente final se entera antes que el equipo interno. Cuando alguien pide explicaciones, el proveedor no tiene un panel que muestre qué pasó, o lo tiene y no lo comparte porque “es parte de su propiedad intelectual”. La empresa terminó dependiendo de una caja negra que no puede auditar, pagando una mensualidad fija por un resultado que nadie puede demostrar que mejoró. Eso no es un problema de la tecnología: es un problema que se decidió mal antes de firmar, cuando nadie exigió ver cómo se iba a medir el servicio.

Qué distingue al proveedor correcto, y por qué no es la demo

Toda demo de agentes de IA se parece a todas las demás: son rápidas, contestan bien, y están diseñadas para que el comprador diga que sí. La diferencia entre un proveedor que va a operar de verdad y uno que va a desaparecer después del cobro del primer mes no está en la demo, está en lo que acepta poner por escrito antes de que exista contrato. Un proveedor que ya operó agentes en producción sabe exactamente qué número va a mover, porque lo ha visto moverse antes en otros clientes. Un proveedor que solo ha hecho pilotos o integraciones puntuales evita ese compromiso, porque comprometerse a un número significa exponerse a que se lo reclamen.

Definición

El proveedor de agentes de IA correcto se distingue por lo que se compromete a medir, no por la demo. El que no acepta un número de referencia no vende operación: vende horas.

Esto tiene una consecuencia práctica en la negociación: la métrica de referencia no puede ser una métrica de vanidad, como “conversaciones atendidas” o “tiempo de actividad del sistema”. Tiene que ser una métrica de negocio, como el porcentaje de casos resueltos sin intervención humana, el tiempo promedio hasta la resolución, o el costo por conversación comparado contra el proceso actual. Qué incluye un servicio gestionado de agentes de IA (y qué debería incluir) es la pregunta que resuelve, en gran parte, si el proveedor ya pensó en esto o lo está improvisando frente a ti.

Las 10 preguntas que filtran al proveedor correcto

Estas preguntas no buscan quedar bien en la reunión, buscan que el proveedor se comprometa con algo verificable antes de que exista una firma. Si una de estas preguntas genera una respuesta vaga o una promesa sin número, ahí está la señal, no en lo que digan después.

  • ¿Qué número de referencia van a usar para medir el antes y el después? Si no puede nombrar la métrica exacta en la primera reunión, no la va a poder reportar en el mes seis.
  • ¿Cuántos agentes tienen hoy operando en producción, no en piloto, y en qué industria? Un proveedor con clientes reales en producción responde esto sin dudar y sin verificar una presentación.
  • ¿Qué porcentaje de las conversaciones termina escalado a un humano, y por qué se escalan esas y no otras? La respuesta muestra si entienden los límites de su propio sistema.
  • ¿Qué SLA de disponibilidad y tiempo de respuesta están dispuestos a firmar, y qué penalidad aplica si lo incumplen? Sin penalidad, el SLA es una frase decorativa, no un compromiso.
  • ¿Cómo se entera la empresa de un incidente, y en cuánto tiempo? Un proveedor serio tiene un proceso de notificación ya definido, no uno que va a “armar cuando pase”.
  • ¿Qué pasa con el servicio cuando el modelo subyacente cambia de versión? Los modelos cambian de comportamiento entre versiones, y alguien tiene que hacerse responsable de volver a validar el flujo.
  • ¿Quién tiene acceso y control sobre los prompts, los flujos y las reglas de negocio configuradas? La respuesta anticipa si vas a poder auditar tu propio sistema o vas a depender de que ellos te muestren capturas de pantalla.
  • ¿Qué pasa con mis datos si termino el contrato? Exportación completa, borrado verificable, o silencio: solo una de esas tres respuestas es aceptable.
  • ¿Cuál es la condición de salida si decido migrar a otro proveedor? Si la respuesta incluye penalidades altas o un periodo de transición sin soporte, ya sabes cómo va a terminar la relación.
  • ¿Qué pasó la última vez que un agente falló en producción con un cliente suyo? Si la respuesta es “nunca nos ha pasado”, o miente o no tiene la trazabilidad para saberlo, y ninguna de las dos opciones es tranquilizadora.

Qué pedir de referencias verificables (y qué no sirve como prueba)

El logo de un cliente en una landing page no es una referencia, es marketing. Una referencia verificable es una conversación directa con la persona que opera el agente día a día del lado del cliente, no con quien firmó el contrato ni con el gerente de marketing que aprobó el caso de éxito. Esa persona te puede decir, sin filtro, cuánto trabajo real le tomó mantener el sistema funcionando y qué tan seguido tuvo que intervenir a mano.

  • Un contacto operativo real, no comercial: alguien que use o supervise el agente todos los días, con nombre y correo verificable, no una cita anónima en un caso de estudio.
  • El número de antes y el número de después, con fecha, no un porcentaje suelto sin línea base. Un porcentaje de mejora sin decir la línea base ni la fecha no es un dato: es una frase.
  • Un incidente real que hayan manejado juntos: qué pasó, cuánto tardaron en notificarlo, y qué cambió después para que no volviera a pasar.
  • Cuánto tiempo lleva ese cliente en producción, no en piloto. Un piloto corto no dice nada sobre cómo se comporta el sistema en un pico de demanda real.

Si el proveedor ofrece referencias pero pide que las preguntas se envíen por escrito y las conteste él mismo “para coordinar mejor”, esa referencia ya no es independiente. Pide la llamada directa, corta, sin el proveedor en la línea. Qué documentos exigirle a un proveedor de IA antes de firmar detalla la contraparte de esta verificación: qué papel, no solo qué conversación, debería respaldar cada afirmación.

Las señales de alerta que anticipan un mal contrato

Ninguna de estas señales aparece sola, aparecen en combinación, y cuando lo hacen suelen anticipar exactamente el mismo problema: estás por comprar horas de consultoría disfrazadas de producto.

  • Promete autonomía total del agente desde el primer mes. Ningún sistema de agentes serio opera sin supervisión humana desde el día uno; quien lo promete o no entiende el riesgo o lo está ocultando.
  • No menciona límites del sistema sin que se lo pidas. Un proveedor que ya operó en producción conoce los casos donde el agente falla, y los menciona antes de que preguntes, no después.
  • No menciona ningún incidente pasado. Todo sistema con suficiente volumen ha fallado alguna vez. Que no tengan una historia que contar es la historia.
  • Cotiza un precio cerrado sin haber revisado tus datos ni tu proceso actual. Sin diagnóstico previo, ese número es una suposición con forma de contrato.
  • Vende “inteligencia artificial” en vez de un resultado de negocio. El lenguaje de la propuesta habla de tecnología y no de la métrica que va a mover, y eso es señal de que todavía no diagnosticaron nada.
  • Evita hablar de la fase de salida cuando se la mencionas. Cambia de tema, la difiere para “cuando llegue el momento”, o la trata como un detalle legal menor.

Qué exigir en la prueba antes de comprometerte a un contrato largo

Una prueba no sirve para “ver cómo funciona”, sirve para responder una pregunta concreta con datos reales de tu operación, no con datos de demostración. Antes de aceptar el piloto, la empresa tiene que dejar por escrito qué métrica se va a medir, con qué línea base y en qué fecha se cierra la evaluación. Sin esos tres elementos, el piloto se puede estirar indefinidamente y terminar convertido en el contrato de facto sin que nadie lo haya firmado como tal.

  • Alcance acotado y con datos reales, no un subconjunto curado que evite los casos difíciles de tu operación.
  • Plazo cerrado, con fecha de inicio y de cierre acordada antes de empezar, no “hasta que funcione”.
  • Métrica de éxito pactada por escrito antes del primer día, no negociada al final según cómo salieron los números.
  • Condición de salida sin penalidad si el piloto no cumple la métrica, incluyendo qué pasa con los datos cargados durante la prueba.

Esto también responde la pregunta de fondo entre agentes de IA como servicio o desarrollo propio: un piloto bien diseñado te da evidencia real para decidir, en vez de una intuición basada en qué tan simpático fue el equipo de ventas.

De quién es la configuración y los datos cuando termina el contrato

Aquí es donde más empresas quedan atrapadas sin haberlo decidido a propósito. Los prompts, los flujos de conversación, las reglas de negocio que se configuraron durante meses de ajuste fino son, en la práctica, el activo que hace que el agente funcione bien para tu operación específica. Si esa configuración vive dentro de una plataforma propietaria del proveedor, sin posibilidad real de exportarla a un formato que otro proveedor pueda leer, la empresa no compró un sistema: alquiló el criterio de alguien más sobre cómo debería funcionar su propio proceso.

Antes de firmar, pide que quede explícito en el contrato: quién es dueño de la configuración, en qué formato se puede exportar, y qué pasa con el historial de conversaciones que alimentó ese ajuste. Esto no es un detalle legal menor dentro del despliegue de agentes de IA empresariales: es la diferencia entre poder migrar de proveedor sin perder meses de trabajo, o quedar rehén de uno solo porque ahí vive todo lo que se aprendió sobre tu negocio.

Las condiciones de salida se negocian antes de firmar, no cuando ya quieres irte

Nadie negocia bien una salida cuando ya está enojado con el proveedor y necesita irse rápido. Por eso las condiciones de salida se definen en la misma mesa donde se negocia el precio, no después. Un contrato que no menciona qué pasa si una de las partes decide terminar la relación no es un contrato incompleto: es una señal de que el proveedor prefiere que esa conversación nunca ocurra en condiciones donde tú tengas poder de negociar.

  • Periodo de aviso razonable, definido en semanas, no en un “se conversa en su momento”.
  • Soporte de transición durante la migración, no un corte inmediato del servicio el día que se vence el contrato.
  • Exportación completa de datos y configuración, en un formato utilizable, sin costo adicional ni negociación posterior.
  • Sin penalidades por salir dentro de los términos pactados. Una penalidad alta por cancelar antes de tiempo es, en la práctica, un candado disfrazado de cláusula estándar.

Cómo elegir un consultor de IA para tu empresa (sin arrepentirte a los tres meses) trata el mismo problema desde el lado de la contratación de personas en vez de proveedores de agentes, y la lógica de fondo es idéntica: la salida se negocia con la misma seriedad que la entrada, porque es la parte del contrato que solo importa cuando ya es tarde para negociarla bien.

Mi criterio antes de firmar cualquier contrato de agentes gestionados

Mi criterio

No firmo, ni recomiendo firmar, con un proveedor que no acepta poner un número de referencia en el contrato antes de empezar. No porque el número vaya a ser perfecto, sino porque negarse a comprometerse con uno dice que el proveedor no sabe, o no quiere que tú sepas, qué tan bien opera realmente su propio sistema. Prefiero un proveedor más caro que se compromete con una métrica concreta y la falla alguna vez, que uno barato que solo promete “inteligencia artificial” y nunca se hace responsable de un resultado. Y desconfío en particular de los que hablan mucho de autonomía y poco de límites: en mi experiencia, el que no habla de dónde falla su sistema todavía no lo ha visto fallar en producción de verdad, y tú vas a ser quien pague esa primera vez.

El criterio final no es complicado, aunque casi nadie lo aplica en la reunión de venta: cualquier proveedor de agentes de IA que no pueda mostrarte una métrica de negocio, un incidente que resolvió y una condición de salida sin penalidad, todavía no está listo para operar tu proceso, sin importar qué tan bien haya salido la demo.

Preguntas frecuentes

¿Qué le pregunto en la primera reunión con un proveedor de agentes de IA?

En la primera reunión pide dos cosas concretas, no una lista larga de funciones. Primero, qué número de negocio se compromete a mover (tiempo de resolución, porcentaje de casos resueltos sin intervención humana, costo por conversación) y con qué línea base lo va a comparar. Segundo, pide un ejemplo real de un incidente que hayan manejado con otro cliente y cómo lo resolvieron. Si la reunión se va entera en funcionalidades y demos, sin que nadie mencione una métrica ni un caso de falla, todavía no estás evaluando un proveedor de operación: estás viendo una presentación de ventas bien armada, que es una cosa distinta y mucho menos útil para decidir.

¿Cómo verifico que un proveedor ya operó agentes de IA en producción, y no solo en pilotos?

Pide el nombre de al menos un cliente con más de seis meses en producción real, no en fase de piloto, y solicita hablar directamente con la persona que opera el sistema del lado de ese cliente, no con quien firmó el contrato. Pregúntale a esa persona cuánto tuvo que intervenir a mano en el último mes y si hubo algún incidente. Un proveedor con historial real de producción no duda al dar ese contacto ni pide coordinar la llamada con anticipación “para prepararla”. Si solo puede mostrar casos de estudio con logos y sin contacto verificable, probablemente todavía no tiene el volumen de producción que dice tener.

¿Qué señales indican que voy a quedar amarrado a un solo proveedor de agentes gestionados?

La señal más clara es que la configuración (prompts, flujos, reglas de negocio ajustadas durante meses) vive dentro de una plataforma propietaria sin opción real de exportarla a un formato que otro proveedor pueda usar. Otra señal es un contrato que no menciona qué pasa con tus datos ni con el historial de conversaciones si terminas la relación. Y una tercera, más sutil, es que el precio de salida o el periodo de transición nunca se discutió antes de firmar, así que cuando llega el momento de irte, esas condiciones las define el proveedor con todo el poder de negociación de su lado, no del tuyo.

¿Cuánto debería durar una prueba piloto antes de firmar un contrato largo?

No hay un número universal, pero sí una condición: el piloto debe durar lo suficiente para atravesar al menos un pico real de volumen de tu operación, no solo una semana tranquila. Lo que importa más que la duración exacta es que el plazo esté cerrado desde el inicio, con fecha de cierre y métrica de éxito pactada por escrito antes del primer día. Un piloto sin fecha de cierre tiende a convertirse en el contrato real sin que nadie lo haya negociado como tal, y ahí pierdes la palanca de negociación que sí tenías antes de empezar a depender del sistema.

¿Qué diferencia hay entre un proveedor gestionado de agentes de IA y un consultor que configura y se va?

El consultor entrega una configuración inicial y se retira; lo que pase después con el mantenimiento, los incidentes o los cambios de versión del modelo queda por tu cuenta. El proveedor gestionado se queda operando el sistema, y por eso mismo tiene que aceptar comprometerse con métricas de operación continua, no solo con un entregable de arranque. La confusión entre ambos modelos es donde más empresas terminan pagando una mensualidad de “servicio gestionado” por algo que en la práctica es soporte esporádico sin ningún compromiso de resultado ni de tiempo de respuesta ante un incidente.

Fuentes

Este artículo sintetiza y pone en contexto de negocio material público de estas fuentes. Léelas directo; aquí solo se agrega criterio de implementación.

  1. Anthropic documenta cómo diseñar agentes con límites claros y evaluación continua, la misma exigencia que debería trasladarse a cualquier proveedor externo antes de firmar. anthropic.com
  2. El marco de gestión de riesgos de IA del NIST detalla qué controles y qué roles de gobierno debería exigir una empresa antes de delegar una operación a un sistema automatizado. nist.gov
  3. El análisis de McKinsey sobre el estado de la adopción de IA muestra que buena parte de las empresas que no logran escalar agentes es porque nunca definieron cómo medir el resultado. mckinsey.com
  4. BCG analiza por qué la madurez organizacional, no la tecnología, es lo que determina si una empresa logra medir y sostener el retorno de un proyecto de IA. bcg.com

Sigue explorando

Sigue por aquí

Ver todas las páginas de Agentes gestionados · Ver todo el Playbook AI Native

José Andonaire

Sobre el autor

José Andonaire

Ayudo a empresas de Latinoamérica y España a identificar, priorizar e implementar oportunidades de inteligencia artificial que generen resultados reales para el negocio. Lo que publico sale de implementaciones reales, no de teoría.