Cómo crear un agente IA con Claude en 2026: la guía práctica

8 min de lectura

Crea un agente IA con Claude en 2026: elección de modelo (Opus 5, Sonnet 5, Fable 5), bucle agent, memoria y seguridad. Guía práctica con código.

Primer plano de manos escribiendo en el teclado de un portátil en una habitación débilmente iluminada

Crear un agente IA con Claude se reduce a encadenar tres componentes: un modelo capaz de llamar herramientas, un bucle que ejecuta esas llamadas, y una elección de tier que no dispare la factura. La API Claude expone todo esto de forma nativa. Lo que más suele atascarse es la elección del modelo, no la arquitectura.

Esta guía parte de cero y cubre cinco pasos concretos, desde la elección del modelo hasta la puesta en producción, con los errores que vemos recurrentemente en nuestros clientes. Si vienes del no-code, sigue siendo útil: entender qué ocurre bajo el capó evita sorpresas desagradables con la facturación.

1. Elegir el modelo Claude adecuado para tu agente

Anthropic cambió su catálogo este año. Se acabó el enfoque de un único modelo insignia: la línea Claude 5 se construye sobre tres tiers especializados, Opus 5, Sonnet 5 y Fable 5, que comparten todos una ventana de contexto de un millón de tokens a nivel de API.

tech-insider.org, Claude Opus 5 vs Sonnet 5 vs Fable 5, agosto de 2026 "Anthropic's Claude 5 lineup replaced the old single-flagship approach with three purpose-built tiers, all sharing a 1-million-token context window at the API level."

Según este artículo, Opus 5 se lanzó el 24 de julio de 2026. Es el modelo que debes reservar para tareas de razonamiento complejo: planificación multietapa, orquestación entre agentes. Sonnet 5 cubre la mayoría de casos de uso de agentes clásicos, soporte al cliente, extracción de datos, resumen de tickets. Fable 5, por su parte, busca velocidad y coste para tareas repetitivas de alto volumen.

La mayoría de equipos empiezan con el modelo más caro por reflejo. Rara vez es necesario. En cuanto al coste: Fable 5.1 factura 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, sin caché.

VentureBeat, 1 de septiembre de 2026 "Fable 5.1 retains Fable 5's headline API rates: $10 per 1 million input tokens and $50 per million output."

Según VentureBeat, leer del caché cuesta un 75 % menos con esta versión. En la práctica: si tu agente reutiliza el mismo prompt del sistema en cada llamada, activar el caché cambia tu factura de fin de mes.

Trampa: lanzarse a Opus 5 "porque es el más potente" para un agente que solo hace clasificación simple. Prueba primero en el tier más barato. Sube solo si la calidad de salida lo exige de verdad.

2. Definir las herramientas que el agente puede llamar

Un agente sin herramientas es un chatbot. Nada más. La diferencia está aquí: describes cada función disponible con un esquema JSON, y el modelo decide por sí solo cuándo llamarla.

{
  \"name\": \"get_order_status\",
  \"description\": \"Récupère le statut d'une commande à partir de son numéro\",
  \"input_schema\": {
    \"type\": \"object\",
    \"properties\": {
      \"order_id\": { \"type\": \"string\" }
    },
    \"required\": [\"order_id\"]
  }
}

El modelo devuelve un bloque tool_use cuando juzga que la llamada es necesaria. Tu código ejecuta la función real, luego devuelve el resultado en el siguiente turno de conversación. Este es todo el principio del function calling nativo de la API Claude, no necesitas un framework de terceros para empezar.

Un agente también puede solicitar dos o tres herramientas en el mismo turno, en paralelo. Es útil para un agente que deba cruzar un pedido de Shopify con un ticket de soporte antes de responder, por ejemplo.

¿Necesitas un agente IA conectado a tus herramientas de negocio?

3. Construir el bucle del agente (agent loop)

Esta es la parte donde la mayoría de tutoriales se detienen demasiado pronto. Un agente no es una sola llamada a API. Es un bucle que gira mientras el modelo solicita herramientas.

El flujo típico:

  1. Enviar el mensaje del usuario y la lista de herramientas disponibles
  2. Si la respuesta contiene un tool_use, ejecutar la función correspondiente
  3. Devolver el resultado al modelo en un nuevo mensaje
  4. Repetir hasta que el modelo devuelva una respuesta final sin llamada de herramienta

Trampa: olvidar un límite de turnos. Un agente mal delimitado puede quedarse en bucle sobre una herramienta que siempre devuelve error, consumiendo tokens en cada iteración sin detenerse nunca. Un límite de diez turnos basta para la mayoría de casos que tratamos con nuestros clientes.

Ya detallamos este tipo de desviaciones en nuestro artículo sobre el coste de los agentes IA en producción: el bucle sin límites es justamente una de las causas más frecuentes de facturas desbocadas.

4. Añadir memoria y contexto persistente

Un agente que lo olvida todo entre sesiones no es muy útil para uso empresarial. Dos opciones: gestionar la memoria tú mismo resumiendo e reinyectando el historial, o pasar por un servidor MCP que exponga una fuente de datos externa como memoria persistente.

Ya entramos en detalle en el protocolo en nuestra definición del servidor MCP. Para resumir: MCP estandariza la forma en que un agente se conecta a una base de datos, un CRM o un sistema de ficheros, sin reescribir un conector por herramienta y por cliente.

Con el caché de prompt un 75 % más barato en Fable 5.1, mantener un contexto largo es bastante menos penalizador económicamente que hace unos meses. Esto cambia el cálculo para los agentes que deben recordar un historial de conversación completo.

5. Asegurar y monitorizar el agente antes de pasar a producción

Antes de conectar un agente a datos reales, tres verificaciones son imprescindibles. Limitar los permisos de cada herramienta a lo estrictamente necesario. Registrar cada llamada de herramienta con su coste en tokens. Prever un modo degradado si la API devuelve un error. Estas tres verificaciones son la base de cualquier agente IA en producción, sea cual sea el modelo que uses detrás.

Vimos este escenario con un cliente que gestiona soporte de e-commerce: una herramienta que devolvía sistemáticamente un error, sin límite de turnos, y una sesión que giró toda la noche antes de que alguien se diera cuenta.

Anthropic documenta esta cuestión en materia de seguridad. Sus equipos publicaron investigación sobre cómo agentes Claude, en entorno controlado, contribuyeron a corregir grietas de alineamiento, señal de que la fiabilidad de los agentes autónomos va mucho más allá del alcance de un tutorial técnico.

Si tu equipo tiene menos de cinco desarrolladores, no construyas un sistema de observabilidad desde cero. Una tabla Postgres con el coste por llamada y el nombre de la herramienta basta para empezar. Lo afinarás después.

Conclusión

Tres cosas a recordar. La elección del modelo, Opus 5, Sonnet 5 o Fable 5, pesa más en tu presupuesto que la arquitectura del bucle en sí. El bucle del agente siempre debe tener un límite de turnos, sin excepciones. Y la memoria persistente se piensa desde el principio, no de urgencia después del primer fallo en producción.

Si quieres que miremos juntos cómo conectar un agente IA a tus herramientas empresariales existentes, el equipo de fstck.co acompaña este tipo de proyectos de principio a fin.

Preguntas frecuentes

¿Qué modelo Claude elegir para un agente que llama muchas herramientas en paralelo?

Sonnet 5 cubre la mayoría de casos de uso de orquestación de herramientas. Reserva Opus 5 para escenarios que requieren razonamiento multietapa complejo, y prueba Fable 5 si importan más la latencia y el coste que la precisión.

¿Cuánto cuesta un agente IA basado en Claude en producción?

Depende del modelo y del volumen de tokens en caché. Fable 5.1 factura 10 dólares por millón de tokens de entrada y 50 dólares de salida en tokens no cacheados, con reducción del 75 % en lecturas en caché.

¿Hay que usar MCP o el function calling nativo de la API Claude?

El function calling nativo basta para un agente con pocas herramientas fijas. MCP se vuelve interesante cuando quieres exponer la misma fuente de datos a un agente Slack y a un agente de soporte sin duplicar el código de conexión.

¿Puede un agente IA Claude funcionar sin framework como LangChain?

Sí. El bucle del agente base cabe en unos cincuenta líneas de código alrededor de la API Claude. Un framework es útil sobre todo cuando orquestas tres o más agentes entre sí, no para un agente aislado.

¿Cuál es la principal limitación de este enfoque?

No gestiona la coordinación entre tres o más agentes trabajando en paralelo sobre la misma tarea. Para eso necesitas una capa de orquestación adicional, lo que va más allá del alcance de un primer agente funcional.

Équipe Fullstack
Síguenos en LinkedIn →

Hablemos de tu proyecto

¿Tienes un proyecto en marcha, una idea audaz?
Reunámonos y hablemos de ello.

Contáctanos