Por qué Claude debe estar en tu inquilino de Azure

Descubre qué cambios se producen en materia de seguridad, identidad y gastos cuando Claude analiza Microsoft Foundry, así como las cuatro decisiones clave que hay que tener en cuenta si «dentro del inquilino» debe significar que no haya inferencias propias, y punto.

En 60 segundos

  • La objeción nunca se centró en el modelo. Son el alcance (un agente lee todo tu repositorio, no solo un archivo pegado), el volumen (cientos de solicitudes sin revisar, no solo una) y la información de identificación personal (PII) lo que está llegando a los chats, los registros y la telemetría.
  • Claude ya está disponible de forma general en Microsoft Foundry, alojado en Azure: tu región, tu Entra ID, tu factura de Azure y tu registro de auditoría.
  • La identidad es la mayor ventaja que pasa desapercibida. No hacen falta claves de API estáticas. Los agentes se ejecutan con una identidad gestionada y el acceso condicional funciona a la perfección.
  • La facturación presenta dos dificultades para las que casi nadie establece medidas de protección: el aislamiento a nivel de suscripción y qué modelos de implementación existen realmente.
  • Una pasarela situada frente a Foundry (Azure API Management, Databricks Mosaic AI Gateway o LiteLLM/Portkey) convierte la gobernanza de un simple documento en un punto de control.
  • «Cero intervención antropogénica» no es una afirmación que se pueda hacer con veracidad. Sin embargo, existe una versión más limitada que sí lo es. Es importante conocer la diferencia antes de que los servicios jurídicos la descubran por ti.
Por dónde empezar
  • Responsables de seguridad y cumplimiento normativo: la siguiente sección y «Cuando el requisito es que no haya ningún tipo de inferencia de primera mano».
  • Equipos de TI y de plataformas en la nube: «Identidad y credenciales» y «Comportamiento del gasto»
  • Desarrolladores: «1P , 3P y las superficies que conservas»
  • Patrocinadores empresariales: este recuadro y «Esto no es solo una historia de desarrolladores»
La duda que nadie expresa en voz alta

Ya he tenido alguna versión de esta conversación una docena de veces. Un cliente está entusiasmado con los agentes de programación, la prueba piloto ha salido bien, los desarrolladores están pidiendo licencias y, de repente, alguien del departamento de seguridad se une a la llamada y el ambiente se enfría unos 10 grados.

Rara vez la objeción es «no confiamos en el proveedor». Suele ser más concreta que eso y más razonable.

Un asistente de chat ve todo lo que pegas en él. Un agente de programación ve todo tu repositorio: el directorio de configuración, los nombres de host internos, el middleware de autenticación, los datos iniciales que se suponía que eran sintéticos —y en su mayor parte lo son— y ese archivo que tiene todo código fuente y que alguien debería haber eliminado en 2019. 

Asigna un agente a un monorepo y pídele que solucione una prueba que falla, y se encargará encantado de leer los 40 archivos cuya existencia habías olvidado para averiguar por qué. La preocupación nunca fue realmente el modelo, sino el alcance de las consecuencias.

Luego está el volumen. Una interacción de chat es una solicitud en la que has pensado antes de enviarla. Un bucle de agente son cientos de solicitudes que nadie ha revisado individualmente. Cualquier cosa que te inquiete que pueda contener una sola instrucción, un agente acabará enviándola, a las tres de la madrugada, desde un ejecutor de compilaciones, mientras todo el mundo duerme. Si tu proceso de revisión parte de la base de que un humano decide cada vez lo que se envía por la red, los agentes rompen esa suposición desde el primer día.

En parte, esto no es en absoluto una cuestión de preferencia. Muchas organizaciones operan bajo obligaciones que no han elegido, como los requisitos de residencia que especifican una zona geográfica, los compromisos contractuales sobre la conservación de datos y los organismos reguladores del sector que, en última instancia, preguntarán qué ha sido de una determinada solicitud de inferencia. La banca, los seguros y las ciencias de la vida son los casos más evidentes, pero estas obligaciones están presentes en casi todos los sectores regulados. La conversación más animada sobre este tema la mantuve con una aseguradora cuyo responsable de seguridad quería saber exactamente qué datos de siniestros podía ver un agente mientras se reestructuraba el servicio de tramitación de siniestros. Es una pregunta razonable, y desde entonces me la ha planteado también un fabricante.

Nada de esto supone una crítica a los servicios de IA alojados en general; los principales proveedores cuentan con políticas sólidas y certificaciones reales. Pero «nuestra política nos compromete a X» y «esta es la ruta de red que siguieron los bytes, en una región que tú mismo has especificado, en virtud de tu propio contrato» son dos tipos distintos de garantía, y algunas organizaciones están obligadas a aportar este segundo tipo. Una política es algo en lo que confías. Una arquitectura es algo que puedes mostrar a alguien.

Así que la verdadera pregunta no es si el modelo es bueno, sino si se puede conseguir uno bueno sin renunciar a la capacidad de responder a esas preguntas.

Ventajas de ejecutarlo en tu propio tenant

A partir de junio de 2026, los modelos de Claude estarán disponibles de forma generalizada en Microsoft Foundry, incluida una opción alojada en Azure. Para un cliente que ya haya adoptado Azure como plataforma estándar, esto cambia considerablemente el panorama. Esto es lo que ocurre dentro de tu entorno:

  • Elección de la región. La mayoría de los modelos de Claude en Foundry se implementan a nivel mundial, y varios de ellos también ofrecen la opción de una zona de datos en EE. UU. que limita el lugar desde donde se atienden las solicitudes. Para un cliente con un requisito de residencia, esa es la diferencia entre una certificación y una configuración de implementación.
  • Retención de datos nula, incluida en tu contrato de Azure en lugar de en uno independiente. Confírmalo expresamente en lugar de darlo por sentado, pero ten en cuenta que figura en un contrato que tu equipo jurídico ya ha leído.
  • La configuración de red que ya tienes en marcha. Terminales privados, salida controlada… lo mismo que aplicas a cualquier otro servicio de Azure. Tu agente deja de ser una excepción para el cortafuegos.
  • Una identidad propia, a través de Entra ID en lugar de una clave API. (Más información a continuación; es el aspecto que suele convencer por sí solo.)
  • Facturación y auditoría justo donde ya las consultas. El consumo aparece en tu factura de Azure; la telemetría se encuentra en el mismo espacio de trabajo que el resto.
  • Las medidas de seguridad son las que tú estableces, no las que te vienen por defecto. Las medidas de seguridad de Azure AI Content Safety y Foundry Agent Service están disponibles para las cargas de trabajo de Claude, pero los filtros no se activan automáticamente al implementarlas, como ocurre con los propios modelos de Microsoft. Claude incluye sus propias medidas de seguridad; tú decides qué medidas añade Azure además de las tuyas.

La experiencia de desarrollo en sí misma no cambia prácticamente nada. Claude Code CLI se comporta igual que en cualquier otro sitio, al igual que las extensiones de VS Code y JetBrains, el SDK del agente, los subagentes, los hooks, las habilidades, los complementos, los servidores MCP, los puntos de control y el entorno aislado. El almacenamiento en caché de las peticiones y el «pensamiento extendido» funcionan. Lo que sí cambia es el conjunto de entornos en los que Anthropic opera en tu nombre, tal y como se explica más adelante en «1P, 3P y los entornos que conservas».

Identidad y credenciales

De todo lo que aquí se trata, el modelo de autenticación es el que tiene un mayor impacto en las fases posteriores y, sin embargo, es al que menos atención se le presta.

Claude Code en Foundry puede autenticarse a través de la cadena de credenciales estándar de Azure y de Entra ID, en lugar de mediante una clave de API. Los agentes de compilación se ejecutan con una identidad gestionada. Los desarrolladores se autentican con su propia identidad, por lo que el acceso condicional, la gestión de identidades privilegiadas y el cumplimiento normativo de los dispositivos se aplican al acceso al modelo de la misma forma que se aplican al resto del inquilino.

No hay ninguna credencial de larga duración que emitir, rotar, que pueda filtrarse o que haya que buscar en un repositorio dentro de tres años. Si te has pasado los últimos años eliminando las credenciales estáticas de todo tu entorno, eso es más importante que el cambio de modelo.

Es el momento en el que los equipos de seguridad dejan de hacer preguntas y empiezan a preguntar por los plazos.

Cómo se comporta el gasto

La facturación pasa a realizarse a través de Azure. Foundry factura a Claude a través de Azure Marketplace utilizando «Unidades de consumo de Claude», que se calculan a partir del uso de tokens según las tarifas publicadas por modelo, y que figuran en tu factura consolidada. Los clientes con un Contrato Enterprise (EA) que cumplan los requisitos pueden deducir este importe de un compromiso de consumo de Azure ya existente.

Microsoft Cost Management se convierte en tu plataforma de gestión de gastos, y tus presupuestos, etiquetas y alertas actuales se transfieren a ella. Hay dos aspectos que conviene definir desde el principio:

1. El límite de aislamiento es la suscripción, no el recurso.
Azure gestiona la cuota de implementación a nivel de suscripción; los recursos y las regiones la comparten, en lugar de recibir asignaciones independientes. Asignar a cada equipo su propio recurso de Foundry dentro de una misma suscripción no aísla nada. Una separación real entre equipos (o entre desarrollo y producción) implica suscripciones independientes. La mayoría de las organizaciones se dan cuenta de esto la tarde en que el bucle de reintentos de alguien encuentra la forma de ejecutarse indefinidamente.

2. Determinar qué implementaciones existen es la mejor forma de controlar los costes, y casi nadie la utiliza.
Claude Code asigna los niveles de los modelos a las implementaciones que hayas creado. Un equipo que no deba utilizar tu modelo más caro simplemente no obtendrá una implementación para él. Impone esta asignación mediante una configuración gestionada de forma centralizada y el tema dejará de plantearse, lo que supone un control mucho mejor que una alerta presupuestaria que se activa cuando el dinero ya se ha agotado. Fija versiones específicas de los modelos en lugar de rastrear la «última versión». Los alias se resuelven con un valor predeterminado integrado que puede ir por detrás de la versión más reciente, y un modelo que falta aparece como una solicitud fallida en lugar de un mensaje claro en el momento del lanzamiento.

La gestión de la caché y del contexto también es importante. La tasa de aciertos en la caché de comandos es un gasto real una vez que se ejecutan las cargas de trabajo de los agentes, y una ventana de contexto amplia es, al mismo tiempo, una capacidad y un riesgo de gasto. 

Tus dos cifras de coste no coincidirán

Es mejor saberlo ahora que durante una revisión de devolución de cargo. El panel de análisis de Anthropic y la API de Claude Enterprise Analytics no están disponibles en Foundry. La atribución por desarrollador y por equipo se obtiene, en su lugar, a través de la exportación de OpenTelemetry de Claude Code a Log Analytics, Application Insights o Databricks, y la telemetría viene desactivada de fábrica, por lo que activarla es un paso deliberado en tu proceso de implementación.

El problema es que la cifra de costes que proporciona Claude Code es una estimación del lado del cliente basada en tarifas estándar, mientras que tu factura se basa en unidades de consumo y puede reflejar precios negociados. Por lo tanto, habrá diferencias entre ambas. Considera la gestión de costes como los datos reales y la telemetría como la capa de atribución. No crees un modelo de reembolso que dé por hecho que ambos datos coinciden. El departamento de finanzas siempre se da cuenta.

A cambio, los datos de telemetría de tu modelo se almacenan en el mismo espacio de trabajo que el resto de señales de tu plataforma. Una única política de retención, un único SIEM, un único lugar al que acudir cuando alguien solicite pruebas.

Pon algo delante

Una vez que la inferencia se encuentra dentro de tu tenant, también puedes integrarla con una pasarela de IA, algo que, de otro modo, resulta complicado de llevar a cabo de forma limpia cuando el modelo es un punto final SaaS al que tus herramientas acceden directamente. Es una de las ventajas menos evidentes de esta solución.

Dirige Claude Code, tus aplicaciones internas y Claude Desktop a través de una puerta de enlace que controles antes de que el tráfico llegue a Foundry. Las funciones de IA generativa de Azure API Management son la opción nativa de Azure. Si tu plataforma de datos es Databricks, al registrar el punto final de Foundry como un modelo externo detrás de Unity Gateway (Mosaic), este pasa a formar parte de Unity Catalog. Los permisos, el linaje y el modelo de auditoría que ya utilizas para los datos se aplican ahora al acceso a los modelos, y cada solicitud se registra en tablas de inferencia que puedes consultar como cualquier otra cosa para utilizarlas en evaluaciones, entrenamiento o seguridad. LiteLLM, Portkey y herramientas similares realizan la misma función si prefieres mantener la neutralidad respecto a los proveedores.

Se obtiene un único punto de medición, independientemente del cliente que haya realizado la llamada: el coste por equipo, aplicación, modelo y hora, procedente de una fuente que ha registrado todas las solicitudes. Una pasarela es también el lugar donde la gobernanza deja de ser un mero documento: límites de frecuencia, listas de permitidos, comprobaciones de datos personales y registro inmediato de comandos con un periodo de retención que tú mismo estableces. La pasarela aplica todas estas medidas en un único punto de control, en lugar de confiar en cada cliente de forma individual. Y es el lugar natural para el ciclo de vida del desarrollo de IA (SDLC): entornos de evaluación, control de versiones de comandos y comprobaciones de regresión antes de que una nueva versión del modelo llegue a producción.

La disyuntiva es real. Una puerta de enlace añade un salto y desplaza el límite de autenticación. Los clientes se autentican ante la puerta de enlace, y esta controla la ruta hacia Foundry, por lo que el modelo de Entra ID de extremo a extremo se aplica ahora en el perímetro de la puerta de enlace. Para la mayoría de las organizaciones, es una buena disyuntiva. Simplemente hay que tomarla a sabiendas.

1P, 3P y las superficies que conservas

En la documentación de Anthropic y Microsoft se utilizan los términos «1P» (primera parte) y «3P» (tercera parte). La distinción se refiere a quién proporciona la infraestructura para la inferencia, no a quién ha creado la aplicación ni a quién la utiliza.

«De primera parte (1P)» significa que la inferencia se ejecuta en la infraestructura de Anthropic (la opción predeterminada). «Tercero» (3P) significa que se canaliza a través de un proveedor que tú configures, como Microsoft Foundry, Amazon Bedrock, Vertex AI de Google Cloud o una pasarela que tú mismo gestiones. La aplicación es la misma en ambos casos. Lo que cambia es dónde se sirven los tokens, quién los factura y qué sale de tu entorno. Esa distinción también explica los límites de las funcionalidades, ya que algunas capacidades dependen, por su propia naturaleza, de la inferencia alojada por Anthropic:

En tu tenant, a través de FoundrySobre las licencias de claude.ai
API de mensajes, SDK para agentesPestaña «Chat», claude.ai en la web y en el móvil
Claude Code CLI, extensiones para VS Code y JetBrainsRevisión de código, Ultrareview, Rutinas
GitHub ActionsClaude Code en la web, en el móvil y en Slack
Servicio de agentes de fundiciónUso de ordenadores, mercado de competencias
Pestañas «Claude Desktop», «Cowork» y «Code»Consola de análisis de la organización, ajustes gestionados por el servidor

‍

«Foundry» suele abarcar las áreas en las que Claude realiza su trabajo, mientras que «claude.ai» abarca aquellas en las que los usuarios interactúan con Claude y en las que la organización supervisa su funcionamiento. Planifica ambas columnas de forma deliberada. Lo que suele pillar desprevenidos a los equipos es la «Revisión de código», que es muy buena y se encuentra en el lado del usuario.

Esto no es solo una historia de desarrolladores

Claude Desktop también puede ejecutarse en Foundry, lo que convierte esta implementación de ingeniería en una herramienta que el resto de la empresa puede utilizar. En ese modo, aparecen las pestañas «Cowork» y «Code». El historial de conversaciones permanece en el dispositivo del usuario; las inferencias se envían al terminal de Foundry; y la configuración se realiza a través de las herramientas de gestión de dispositivos existentes, en lugar de mediante una consola del proveedor. Además, los usuarios no pueden anularla cuando hay un perfil de administrador activado, lo que supone una gran ventaja en entornos regulados y de alta seguridad.

Anthropic no ofrece licencias por puesto en esta modalidad. La inferencia se factura según el consumo en tu cuenta de Azure, lo que cambia el cálculo a la hora de decidir hasta qué punto ampliar el acceso más allá del equipo de ingeniería.

Puedes exportar la telemetría completa de la sesión a tu propio recopilador de datos, incluidas las solicitudes con el recuento de tokens y el coste estimado, los resultados de la ejecución de herramientas, los errores y la atribución por sesión y por usuario para desgloses por equipo. Los informes de fallos y los análisis de producto vinculados a Anthropic no incluyen contenido de las conversaciones, y puedes desactivarlos por completo. 

El almacenamiento local de las conversaciones también tiene sus pros y sus contras. No se conserva nada en el servidor para su control, pero tampoco existe un archivo central. Si tu agente de supervisión o de tramitación de suscripciones requiere que se conserven las conversaciones, se trata de un problema de arquitectura que hay que resolver, no de una nota al pie que se pueda pasar por alto.

Dos salvedades: la identidad en las rutas de terceros es la identidad del dispositivo local, sin inicio de sesión del proveedor ni consola de administración alojada, por lo que el control centralizado es real, pero se configura como una gestión de terminales más que como IAM. Además, Cowork en 3P sigue en fase beta, y las nuevas funciones se lanzan primero para los servicios propios.

Cuando el requisito es que no haya ningún tipo de inferencia de primera mano

Algunos clientes necesitan la garantía firme de que el contenido de las conversaciones no llegue a los puntos finales propios. Esto es posible, pero requiere tomar cuatro decisiones importantes. 

  1. Limita la opción de alojamiento mediante una política. Foundry ofrece implementaciones tanto alojadas en Azure como en Anthropic, por lo que elegir Foundry no garantiza por sí solo que la inferencia se realice en Azure. Impone el alojamiento en Azure mediante Azure Policy. La otra opción ofrece capacidades que alguien con derechos sobre un grupo de recursos querrá, lógicamente, y ese «querer, lógicamente» es lo que suele provocar la mayoría de las desviaciones en la arquitectura.
  2. Haz que los servicios propios sean inaccesibles, no solo que no se puedan seleccionar. Eso implica una configuración gestionada de forma centralizada, control de salida y que no haya cuentas de claude.ai para los usuarios sujetos a la normativa. Las herramientas de configuración publican los nombres de host que necesitan, que a su vez constituyen la lista definitiva de lo que hay que bloquear.
  3. Desactiva explícitamente la telemetría vinculada al proveedor. Ya está desactivada por defecto para Claude Code en proveedores externos, y puedes desactivarla en la versión de escritorio. Documenta ambas medidas como decisiones, en lugar de como valores predeterminados heredados; «era el valor predeterminado» no es una respuesta que se sostenga ante una auditoría.
  4. Crea tú mismo la interfaz de chat si Cowork no es la opción adecuada para un grupo concreto. Una aplicación ligera basada en las API de inferencia o de agentes de Foundry hereda tu identidad y tu configuración de red, y la mayoría de las grandes empresas ya cuentan con un portal interno de IA que pueden ampliar.
Hacia dónde nos lleva todo esto

La evolución hasta 2026 ha pasado de una simple llamada a la API a algo más parecido a una plataforma de agentes de producción, con resultados estructurados, búsqueda y recuperación de datos en la web, conectores MCP y búsqueda de herramientas que se van incorporando progresivamente a Claude en Foundry.

Antes la cuestión era si un modelo de vanguardia podía funcionar siquiera dentro de un entorno regulado. Ahora la cuestión es qué se crea una vez que eso es posible.

Decide a qué columna pertenece cada carga de trabajo, configura una vez la estructura de identidad, gastos y pruebas, y todos los agentes que lances a partir de este heredarán dicha estructura. De este modo, podrás evitar tener que rediseñar la arquitectura y podrás aprovechar todo lo que ofrece Microsoft Foundry.

Nimble Gravity ayuda a los equipos a hacer esto realidad

Este es precisamente el trabajo que realizamos para clientes del sector financiero y de seguros (FSI) sujetos a regulación, en nuestra calidad de socios certificados de Microsoft y Anthropic. Implementamos un entorno de Foundry con controles de gobernanza, integramos Entra ID y RBAC, colocamos una pasarela delante y dotamos de los medios necesarios al equipo piloto encargado de probarlo. Si tu equipo de seguridad se está planteando estas preguntas en este momento, podemos guiarte a través de un programa acelerador de entre cuatro y seis semanas que te proporcionará una solución lista para producción en tu propio tenant.

¿Listo para construir lo que realmente importa?

Hablemos