Saltar a contenido

Blueprints de Producción

La arquitectura parte de una carga, un modelo operativo y una prueba de aceptación.

Parto de bases oficiales de Google Cloud, AWS y Red Hat y adapto las capas de datos e IA a restricciones reales de seguridad, fiabilidad y coste. Las referencias son puntos de partida upstream; esta página no implica implementaciones publicadas ni certifica un despliegue.

Revisión técnica · 2026-09-05 · Referencia → adaptación → validación → operación

Elegir una Base Adecuada al Alcance

Primero, una recomendación breve; después, el razonamiento completo y sus fuentes.

Fundaciones Cloud

Alcance: Estructura de organización/cuentas, identidad federada, redes, logs centralizados y responsabilidad de facturación. Usar módulos Terraform/OpenTofu validados para el proveedor; portabilidad significa contratos y pruebas consistentes, no recursos idénticos entre proveedores.

Controles: Credenciales CI de corta duración, autoridad separada para plan/apply, excepciones revisadas, estado protegido, restauración y detección de deriva. VPC Service Controls es un control de Google Cloud; AWS necesita sus propias políticas de servicio y organización.

Compromiso: Una landing zone empresarial completa tiene coste operativo. En despliegues pequeños, conservar identidad y auditoría y reducir entornos y servicios compartidos.

Nube Privada e Híbrida

Alcance: OpenShift y GitOps cuando se necesita ejecución privada o ya existe un modelo operativo de clústeres. Validar operadores de virtualización e IA contra la matriz de soporte de la plataforma. Para IaaS de máquinas virtuales, evaluar OpenStack/Kolla como alternativa con operación propia; no es un sustituto directo de una plataforma de aplicaciones.

Controles: Recuperación de clúster y almacenamiento, segmentación, procedencia de imágenes, identidad de cargas, actualización de operadores y capacidad. Un entorno desconectado también requiere distribución de imágenes y modelos.

Compromiso: El hosting privado cambia dónde se ejecutan los datos; no demuestra por sí solo aislamiento, cumplimiento o bajo coste operativo. Incluir almacenamiento, ciclo del hardware y responsables de restaurarlo.

Plataformas Analíticas

Alcance: Prototipar transformaciones con DuckDB/Polars y contratos de datos. Añadir Iceberg con catálogo ante una necesidad multi-motor probada, o evaluar el modelo de catálogo SQL de DuckLake.

Controles: Compatibilidad lector/escritor, evolución de esquema, calidad, replay de CDC, política de snapshots/retención y restauración. Probar acceso por fila y propagación de borrados a datasets derivados.

Compromiso: El almacenamiento abierto no elimina diferencias SQL, autorización de catálogo ni carencias del motor. Promover a BigQuery, Snowflake o Databricks tras comparar semántica y coste de operación.

Serving de IA

Alcance: Un endpoint tras identidad, límites de solicitudes y presupuestos por tenant. Definir calidad, TTFT y latencia entre tokens antes de añadir vLLM/SGLang, enrutamiento KV o separación con llm-d/Dynamo.

Controles: Versionar pesos, tokenizer y configuración; despliegue canary con tareas reservadas; probar sobrecarga, cancelación, límites de fallback y aislamiento de caché. Observar costes y omitir contenido sensible.

Compromiso: Kubernetes, DRA y un gateway encajan en una flota compartida. Un servicio gestionado o un único servidor puede cumplir el mismo SLO con menos operación. Un clasificador complementa autorización; no la sustituye.

Flujos de Agentes

Alcance: Herramientas estructuradas y transiciones de estado explícitas. Incorporar persistencia LangGraph/Pydantic AI para reanudar flujos; usar MCP para herramientas y A2A entre agentes con responsables distintos.

Controles: Verificar identidad y tenant, validar argumentos, aislar ejecución, fijar plazos, claves de idempotencia, checkpoints duraderos y aprobaciones vinculadas a una acción concreta. Probar reintentos alrededor de una escritura externa.

Compromiso: Las decisiones del modelo siguen siendo probabilísticas. El control determinista puede acotar ejecución, pero ciclos, memoria y delegación deben demostrar que compensan sus modos de fallo adicionales.

Completar la base con el modelo Ops compartido y las premisas de UX/UI: responsables, cambios revisados, tareas claras y estados comprensibles.

Catálogo de Referencias

Estos son los principales marcos oficiales que recomiendo y utilizo:

  • Enterprise Foundations Blueprint: La implementación en Terraform de Google de una organización multi-entorno, zonas de aterrizaje y redes e IAM seguros por defecto.
  • Google Cloud Security Foundations Guide: Guía oficial de controles de seguridad e identidad para fundaciones Google Cloud; adaptar alcance y evidencia a los requisitos propios.
  • GCP Cloud Foundation Fabric: El framework modular oficial de Google basado en Terraform para desplegar de forma ágil zonas de aterrizaje empresariales y entornos de prueba.
  • GCP Cloud Architecture Center: El catálogo oficial de Google para arquitecturas de referencia, patrones de diseño y mejores prácticas globales.
  • Enterprise Generative AI & MLOps Blueprint: Referencia empresarial que conecta fundaciones cloud, datos, desarrollo de modelos y operación de IA. Adaptar controles y despliegue a cada carga.
  • Agent Starter Pack: Plantillas iniciales de agentes con Terraform, CI/CD, evaluación y observabilidad para Cloud Run y Agent Engine. Validar permisos, dependencias y recuperación antes de desplegar.
  • Gemini Enterprise Agent Platform — Agent Engine: El runtime administrado de agentes — sesiones, memoria, ejecución de código y herramientas de evaluación — detrás del stack de agentes de Vertex AI.
  • OpenStack / Kolla: arquitectura de producción: Referencia IaaS para separar control, cómputo, redes y almacenamiento. Elegir una versión compatible, diseñar alta disponibilidad y ensayar restauración; el quickstart de un nodo no es una arquitectura de producción.
  • Red Hat OpenShift Platform Plus: El baseline de nube privada — OpenShift con Advanced Cluster Management, Advanced Cluster Security, Quay y Data Foundation — para flotas que abarcan centro de datos, edge y nube pública.
  • OpenShift Virtualization: Ejecuta máquinas virtuales y contenedores en una sola plataforma basada en KubeVirt, una opción de consolidación para parques on-premises.
  • Validated Pattern: Multicloud GitOps: La referencia probada de Red Hat, guiada por GitOps, para gestionar clústeres, aplicaciones y políticas desde una sola consola entre nubes.
  • Validated Pattern: RAG-LLM GitOps: Patrón RAG sobre OpenShift AI con serving, recuperación y aplicación gestionados mediante GitOps. Revisar versiones y alcance de validación.
  • Red Hat OpenShift AI: La plataforma de IA nativa de Kubernetes — serving de modelos sobre vLLM, pipelines, registros y planificación de GPU con asignación dinámica de recursos.
  • llm-d: El stack open source de inferencia distribuida nativo de Kubernetes — prefill/decode desagregado, enrutamiento consciente de la caché KV y control de flujo multi-tenant — que OpenShift AI incorpora.
  • Red Hat AI Inference Server: Distribución vLLM con soporte y LLM Compressor. Comprobar la matriz de modelos, aceleradores y plataformas de la versión elegida.
  • RHEL AI e InstructLab: Una plataforma arrancable de modelos fundacionales con el flujo abierto de InstructLab para ajustar modelos con datos privados.
  • NVIDIA AI Blueprints: Flujos de referencia construidos sobre microservicios NIM — RAG empresarial, extracción multimodal de PDF, humanos digitales — con requisitos de despliegue y acelerador propios de cada flujo.
  • Kubernetes Gateway API Inference Extension: El gateway de inferencia nativo de Kubernetes — enrutamiento por nombre de modelo, conciencia de adaptadores LoRA y salud de endpoints para pools compartidos de servidores de modelos.
  • CNCF Cloud Native AI Whitepaper: La referencia de la CNCF para ejecutar cargas de IA sobre infraestructura cloud native — planificación, almacenamiento, red y observabilidad.
  • OpenTelemetry GenAI Semantic Conventions: El vocabulario compartido para la telemetría de LLMs, agentes y MCP — spans, eventos y métricas — mantenido en un repositorio propio. Fijar revisión y comprobar estabilidad por señal antes de instrumentar.
  • Model Context Protocol (MCP): Protocolo abierto para integrar herramientas y contexto. Negociación de versión, autorización y ejecución segura necesitan implementación explícita; el protocolo no vuelve determinista al razonamiento.
  • Agent2Agent Protocol (A2A): El estándar de la Linux Foundation para que los agentes se descubran y deleguen tareas entre runtimes — la contraparte de MCP.
  • CIS Benchmarks (Center for Internet Security): Los estándares de configuración de seguridad global para plataformas en la nube, clusters de Kubernetes (GKE/EKS/OpenShift), bases de datos y sistemas operativos.
  • Cloud Security Alliance (CSA) Cloud Controls Matrix: El marco de controles de ciberseguridad definitivo para computación en la nube, mapeado con los principales estándares (ISO 27001, SOC 2, NIST SP 800-53).
  • Open Policy Agent (OPA): Motor de políticas CNCF para aplicar reglas explícitas en aplicaciones, Kubernetes e IaC. No es un estándar de cumplimiento ni garantiza que los controles estén correctamente diseñados.
  • OWASP Top 10 for LLM Applications: La lista 2026 de riesgos LLM: inyección de prompts, tratamiento inseguro de salidas, autoridad excesiva y consumo sin límites.
  • NIST AI Risk Management Framework: Marco voluntario Govern–Map–Measure–Manage para organizar el riesgo de IA. Usarlo para asignar controles y evidencia, no como certificación.
  • MITRE ATLAS: La base de conocimiento de tácticas y técnicas adversarias contra sistemas de IA, la contraparte de ATT&CK para el modelado de amenazas.
  • MCP Security Best Practices: La guía del propio protocolo sobre reenvío de tokens, ataques de confused deputy, secuestro de sesión y autorización para servidores MCP.

Criterios para Producción

Una referencia se convierte en diseño desplegable cuando estas comprobaciones tienen responsable, resultado registrado y decisión de rollback.

Criterio Evidencia necesaria
Corrección Tareas representativas, contratos de datos, compatibilidad y regresión
Seguridad Modelo de amenazas, mínimo privilegio, pruebas de denegación y excepciones auditadas
Fiabilidad SLO/RTO/RPO, carga/sobrecarga, datos restaurados y rollback ensayado
Cadena de suministro Dependencias e imágenes fijadas, procedencia, vulnerabilidades y términos de modelos
Economía Coste por resultado aceptado, capacidad ociosa, reintentos, movimiento de datos y operación
Responsabilidad Runbook, escalamiento, retención/borrado y responsable de actualizaciones

Para protocolos y versiones cambiantes, consultar el radar de Tecnologías Emergentes. Para diseñar experimentos, usar el contrato de evidencia de Active Labs.

Un Modelo Operativo entre Disciplinas Ops

Estas disciplinas comparten un ciclo: versionar el cambio, probarlo, autorizar el despliegue, observar el resultado y ensayar la recuperación. Son responsabilidades, no ocho plataformas obligatorias.

Disciplina Qué protege Evidencia que conservar / referencia
DevOps / Platform / DevEx Un camino repetible del cambio al servicio útil Procedencia del build, despliegue y recuperación; métricas DORA
DevSecOps / GitOps Cambios revisados con mínimo privilegio y configuración reconciliada Amenazas, excepciones, deriva y restauración; NIST SSDF
DataOps Datos batch y streaming confiables Contratos, linaje, frescura, calidad y replay; OpenLineage
MLOps Entrenamiento reproducible y promoción controlada de modelos Versiones de datos/modelos, evaluación, deriva y rollback; blueprint empresarial AI/MLOps de Google
LLMOps / AgentOps Comportamiento evaluado y autoridad acotada de herramientas Revisiones de prompts/modelos/herramientas, tareas reservadas, aprobación y replay; AWS Agentic AI Lens
SRE Fiabilidad con carga normal y ante fallos SLO, presupuesto de error, revisión de incidentes y restauración; SRE Workbook
AIOps Investigación asistida de señales operativas Hipótesis con fuentes, revisión de falsos positivos y runbook aprobado por una persona; CloudWatch investigations
FinOps Coste atribuible por resultado útil Facturas asignadas, capacidad ociosa, presupuestos y economía unitaria; FinOps Framework

Gobernanza común: Asignar responsables a datos, modelos y servicios. Mantener identidad, retención/borrado, procedencia y excepciones en un modelo de controles revisable. Un diagnóstico de IA no autoriza remediación; un dashboard no aplica presupuestos; un marco no certifica cumplimiento.

UX/UI para Herramientas de Ingeniería

Este sitio estático Zensical es un pequeño caso de diseño para hacer útiles las ideas técnicas. La interfaz debe mostrar la próxima acción sin exigir que el visitante conozca ya todo el vocabulario.

  1. Explicar por niveles. Una pregunta sencilla lleva a un ejemplo y luego a los detalles SQL avanzados. Mantener la recomendación visible y el contexto adicional opcional. ¿Un visitante nuevo puede ejecutar una consulta útil y explicar el resultado?
  2. Mostrar estado y recuperación. Failure Lab separa espera, guardados, reintentos y rechazos. ¿Se distingue un servicio detenido de trabajo perdido definitivamente?
  3. Sugerir sin ejecutar. El texto tenue y los ejemplos CLI completan la entrada; Enter ejecuta. Comprobar teclado, táctil, posición del cursor y ejecución accidental.
  4. Mantener coherencia visual. Usar tokens de color comunes, superficies discretas y hover contenido. Comprobar contraste claro/oscuro, foco visible, zoom y pantallas pequeñas.
  5. Conservar control y privacidad. Herramientas locales, red explícita, movimiento reducido y contenido legible sin JavaScript. Comprobar Escape, devolución del foco, tratamiento de entradas y solicitudes de red.

El formato debe responder al contenido. La guía de tablas de USWDS recomienda celdas breves y fáciles de recorrer; el razonamiento extenso encaja bajo encabezados o en contenido desplegable. La guía de tarjetas de USWDS desaconseja usarlas solo como bordes decorativos. Siguiendo la guía de detalles de GOV.UK, mantener visible la información esencial y reservar los desplegables para contexto adicional que solo algunos visitantes necesitan.

Usar WCAG 2.2 (fuente publicada por W3C) como referencia de accesibilidad y la guía WAI de contenido desplegable (fuente oficial) para la ayuda. Las comprobaciones automáticas y de navegador detectan defectos; no sustituyen la revisión con ayudas técnicas ni las sesiones de uso.

El código y sus restricciones están en el sistema de diseño. Tools es el ejemplo práctico; Experience Lab propone comprobar comprensión con visitantes técnicos y no técnicos. No se afirma haber realizado ese estudio ni obtenido una certificación de accesibilidad.