"Agente de IA" se ha usado para describir un autocomplete, un chatbot con tres botones y sistemas que compran pasajes sin supervisión. Cuando una palabra cubre todo eso, deja de cargar información.
Aquí va una definición lo bastante estrecha como para servir:
> Un agente de IA es un modelo de lenguaje corriendo en loop, con tools que puede llamar y un lugar donde la gente puede escribirle.
Tres partes, todas obligatorias. Quita el loop y tienes un prompt. Quita las tools y tienes una caja de búsqueda sobre tus documentos. Quita la puerta de entrada y tienes un demo.
El loop es toda la diferencia
Una llamada normal al modelo es un solo tiro. Entra texto, sale texto, el modelo nunca se entera de si la respuesta era correcta.
Un agente recibe un objetivo en vez de una pregunta. Mira las tools disponibles, elige una, ve qué volvió y decide otra vez:
cliente: "¿dónde está el pedido 4471?"
turno 1 el modelo decide: llamar lookup_order(orderId: "4471")
la tool devuelve: { status: "in_transit", eta: "2026-08-14" }
turno 2 el modelo decide: no necesita más tools
respuesta: "Va en camino y debería llegar el 14."Ese segundo turno es lo que un prompt normal no puede hacer. El modelo vio datos reales y cambió su respuesta por eso. Todo lo que impresiona de los agentes sale de repetir esos dos pasos hasta terminar el trabajo.
El loop también explica por qué los agentes fallan de formas en que los chatbots no. Un chatbot con un botón roto muestra un botón roto. Un agente con una tool mal descrita llama la tool equivocada, recibe un resultado plausible y responde con total seguridad encima de él.
Las cuatro partes
| Parte | Qué hace | Qué pasa sin ella |
|---|---|---|
| Modelo | Decide el siguiente paso | Nada decide |
| Tools | Leen y cambian el mundo real | Solo puede hablar de tu negocio, nunca actuar sobre él |
| Memoria | Guarda la conversación y lo que aprendió | Cada mensaje empieza de cero |
| Canal | Dónde lo alcanza un humano | Es un script que solo tú puedes correr |
Casi todo lo que se escribe sobre agentes trata de la primera parte, y casi toda la ingeniería trata de las otras tres.
Las tools son funciones con una descripción que el modelo lee. lookup_order, book_slot, create_ticket, transfer_to_human. Esa descripción importa tanto como tu system prompt, porque es por ella que el modelo decide si este es el momento de llamarla.
La memoria suele ser dos cosas fingiendo ser una: la conversación actual y un knowledge base que el agente consulta. La primera es estado, indexado por quien habla. La segunda es retrieval, y es lo que impide que el agente invente tu política de devoluciones.
El canal es la parte que convierte un proyecto en un producto. Lo que nos lleva a la pregunta que casi todos se saltan.
Dónde viven los agentes de verdad
Un agente que solo existe detrás de un widget de chat en tu sitio alcanza al pequeño grupo de gente que ya está en tu sitio.
Los agentes que se usan viven donde la conversación ya ocurre:
- WhatsApp para soporte, reservas y cualquier cosa conversacional en LATAM, Brasil, India, sudeste asiático y sur de Europa, donde es la app de mensajería por defecto.
- SMS para llegar a cualquiera con un teléfono, sin instalar nada, con la tasa de apertura más alta de esta lista.
- Email para contexto largo, adjuntos e hilos B2B, donde un agente puede leer una solicitud de cotización completa y responderla con una.
- Voz para quien no va a escribir, que sigue siendo la mayoría de la gente sobre cierta edad y todo el que tiene las manos ocupadas.
- Telegram, Instagram y Messenger para comunidades y marcas de consumo cuyo público ya vive ahí.
Por eso "qué modelo uso" rara vez es la decisión que determina si el agente funciona. El modelo es más o menos intercambiable. El canal no.
Los tipos que existen en producción
Dejando de lado los demos, estas son las formas que sobreviven:
El agente de soporte. Responde preguntas desde un knowledge base, consulta el estado de un pedido o una cuenta, y escala a una persona cuando no puede. Por lejos el más común, y el más fácil de medir: tasa de deflexión y tasa de escalamiento.
El agente de reservas. Consulta disponibilidad, retiene un horario, confirma. Pocas tools, valor alto y cero tolerancia al error: agendar dos clientes en el mismo horario es peor que no responder.
El calificador. Habla con leads que entran, hace tres o cuatro preguntas, escribe el resultado en tu CRM y deriva los que valen un humano. El ROI más claro del grupo, porque un lead calificado tiene precio.
El agente programado. Nadie le habla. Corre en un cron, revisa algo y le escribe a una persona cuando la respuesta es interesante. Stock bajo, un pago rechazado, un cliente en silencio hace treinta días. Subestimado, porque el encuadre "conversacional" esconde que los agentes también son buenos empezando conversaciones.
El voice agent. Contesta el teléfono, hace el mismo trabajo que el agente de soporte, con un presupuesto de latencia de cerca de un segundo. Todas las decisiones de diseño vienen después de ese número.
Qué no es un agente
Ser preciso acá vale más de lo que parece, porque la etiqueta equivocada crea expectativas que después toca pagar.
Un chatbot con árbol de decisión no es un agente. Si un humano escribió cada rama, el modelo no está decidiendo nada. Esto igual puede ser el producto correcto: un flow con script es predecible, auditable y barato, y para un menú de cinco opciones le gana a un agente. Mira agente vs chatbot para saber cuándo gana cada uno.
Un modelo respondiendo desde documentos es retrieval. Genuinamente útil, y muchas veces es todo lo que necesitas. Se vuelve agente cuando además puede hacer algo: crear el ticket, no solo explicar cómo crearlo.
Un workflow con un modelo en un paso es un workflow. Si la secuencia es fija y el modelo solo reescribe un texto en el medio, llamarlo agente no agrega nada excepto expectativa.
Una sola llamada al modelo con un prompt largo es un prompt, por largo que sea.
Cuánto cuesta un agente
Tres medidores separados, y la mayoría de las páginas de precios solo menciona el primero.
Tokens. Cada turno del loop es una llamada al modelo cargando la conversación completa. Un agente de tres turnos cuesta aproximadamente tres veces una respuesta única, más el historial que crece. Por eso el límite de turnos es control de presupuesto, no solo válvula de seguridad.
Entrega en el canal. WhatsApp, SMS y voz cobran por mensaje o por minuto, y esas tarifas vienen de Meta y de las carriers, no del modelo. Para un agente con volumen, esta línea suele ser mayor que la de tokens.
Escalamiento humano. Las conversaciones que el agente pasa a un humano siguen costando lo que cuestan. Un agente que deflecta el 60 por ciento de los tickets es un ahorro del 60 por ciento, no del 100, y el business case honesto lo dice.
En Zavu, los agentes pueden correr sobre el provider gestionado zavu, cobrado del balance del proyecto, o sobre tu propia key de OpenAI, Anthropic, Google o Mistral sin markup sobre el costo del modelo. La página de precios tiene los números actuales.
Probar uno
El camino más corto entre leer sobre agentes y hablar con uno. Nada de esto es código que escribas:
terminalnpx skills add zavudev/zavu-skills npx zavudev@latest login npx zavudev agents init
La primera línea le enseña esta API a tu coding agent para que deje de inventar endpoints. La segunda lo autoriza. La tercera es guiada.
agents init guía la creación del sender, baja un agente listo del catálogo y configura los secrets. Desde ahí, npx zavudev deploy lo pone en vivo, y:
terminalnpx zavudev agents test --agent <agentId> --message "¿tienen mesa para cuatro el viernes?"
corre el agente real y te muestra qué diría, sin entregar nada a nadie y sin cobrar nada.
Para seguir leyendo
- Cómo crear un agente de IA: el loop desde cero y después deployado en un canal.
- Agente de IA vs chatbot: la decisión, con los casos donde gana el chatbot.
- Frameworks de agentes de IA comparados: qué capa resuelven de verdad LangChain, CrewAI y los demás.
- Agentes de IA para WhatsApp, SMS y email: la vista de plataforma.