Saltar a contenido

Herramientas de observabilidad y sus funciones

Elige las señales necesarias para investigar un fallo real.

Grafana y Prometheus pertenecen a la misma categoría de observabilidad, pero resuelven partes distintas del problema. Prometheus recopila y almacena métricas y evalúa reglas. Grafana consulta fuentes de datos y ofrece paneles, exploración y alertas. Suelen trabajar juntos; una nota única que enfrente a uno con el otro ocultaría esa relación.

Fuentes revisadas: 2026-09-06. Las versiones y licencias siguientes describen los núcleos revisados de cada proyecto. Son preselecciones editoriales basadas en documentación oficial, sin clasificaciones medidas de rendimiento, fiabilidad o coste.

De un vistazo

Calificación (1–5): una nota editorial de preparación para el encaje indicado en su fila, con fecha 2026-09-06. Suma cinco criterios de 0, 0,5 o 1 punto: mantenimiento, edición abierta (lo que incluye la edición open source sin nivel de pago), madurez y comunidad, alcance operativo e interoperabilidad, con topes para proyectos archivados, estancados o sin versión estable. El desglose está bajo la tabla y el método en el índice del Blog. Una calificación no es un benchmark ni un ranking universal; las secciones por carga siguen decidiendo.

Función Componentes revisados Calificación Licencia del núcleo Qué cambia la decisión
Recopilación de métricas y consultas locales Prometheus 3.14.0 5/5 Apache-2.0 Cobertura de recolección, series activas, retención local y reglas de alerta.
Paneles y exploración Grafana 13.2.1 4,5/5 AGPLv3 Permisos sobre fuentes, plugins y edición OSS o comercial seleccionada.
Métricas a largo plazo Mimir 3.2.0 4/5 AGPLv3 Métricas multiinquilino, almacenamiento de objetos y operación distribuida.
Backend alternativo de métricas VictoriaMetrics 1.151.0 4/5 Apache-2.0 en el núcleo Despliegue de un nodo o clúster, compatibilidad de consultas y límites enterprise.
Consultas globales y retención de Prometheus Thanos 0.42.4 4,5/5 Apache-2.0 Topología existente de Prometheus, deduplicación y componentes de consulta y almacenamiento.
Logs Loki 3.7.7 / OpenSearch 3.8.0 4,5/5
4,5/5
AGPLv3 / Apache-2.0 Exploración por etiquetas frente a búsqueda indexada y su coste de almacenamiento.
Trazas distribuidas Tempo 3.0.3 / Jaeger 2.20.0 4/5
4,5/5
AGPLv3 / Apache-2.0 Investigación de trazas, muestreo, almacenamiento e integración con la interfaz existente.
Perfilado continuo Pyroscope 2.3.0 4/5 AGPLv3 en el servidor Lenguajes compatibles, sobrecarga de recolección e investigación del consumo de CPU o memoria.
Recopilación y envío OpenTelemetry Collector 0.160.0 / Alloy 1.19.2 4,5/5
4,5/5
Apache-2.0 / Apache-2.0 Receptores, procesadores, exportadores y señales admitidas por la distribución elegida.
Envío de notificaciones Alertmanager 0.34.0 4,5/5 Apache-2.0 Agrupación, deduplicación, silencios y entrega al equipo responsable.
Aplicación integrada de observabilidad SigNoz 0.140.0 4/5 MIT en el núcleo; excepciones enterprise Investigación desde una interfaz común, operación del backend y controles de la edición exacta.
Cómo se calculó cada calificación

Cinco criterios de 0, 0,5 o 1 punto. Topes: upstream archivado 1, sin versión estable en 18 meses 2, sin versión de disponibilidad general 2,5. "Edición abierta" puntúa lo que incluye la edición open source sin nivel de pago. Puntuado el 2026-09-06 con el repositorio, las versiones y la documentación oficiales; el método está en el índice del Blog.

Proyecto Mantenimiento Edición abierta Madurez Operación Interoperabilidad Calificación
Prometheus 1 1 1 1 1 5
Grafana 1 0,5 1 1 1 4,5
Mimir 1 1 0,5 0,5 1 4
VictoriaMetrics 1 0,5 1 1 0,5 4
Thanos 1 1 1 0,5 1 4,5
Loki 1 1 1 0,5 1 4,5
OpenSearch 1 1 1 0,5 1 4,5
Tempo 1 1 0,5 0,5 1 4
Jaeger 1 1 1 0,5 1 4,5
Pyroscope 1 1 1 0,5 0,5 4
OpenTelemetry Collector 1 1 0,5 1 1 4,5
Alloy 1 1 0,5 1 1 4,5
Alertmanager 1 1 1 1 0,5 4,5
SigNoz 1 0,5 1 0,5 1 4

AGPL es una licencia open source. Las distribuciones comerciales de Grafana, los directorios enterprise y los plugins pueden tener otros términos; el nombre de un proveedor no determina la licencia de todos sus componentes. El resumen de licencias de Grafana y cada repositorio revisado establecen esos límites.

Empieza por el incidente

  • Un servicio pequeño necesita métricas útiles: comienza con Prometheus, Grafana y una ruta explícita de entrega de alertas. Añade infraestructura de retención cuando la historia, disponibilidad o escala real lo requieran.
  • Varias instalaciones de Prometheus necesitan historia compartida: compara Thanos, Mimir y VictoriaMetrics con la topología actual y consultas representativas. Incluye datos ausentes, deduplicación y límites entre inquilinos.
  • La investigación empieza por etiquetas de servicio y rangos de tiempo: preselecciona Loki para logs. Incluye OpenSearch cuando la búsqueda indexada en contenido y campos sea central para el trabajo.
  • Una petición atraviesa varios servicios: compara Tempo y Jaeger con peticiones instrumentadas y una política de muestreo. El almacenamiento no puede reconstruir spans que nunca se recopilaron.
  • La demora está dentro de un proceso: evalúa Pyroscope para perfilado y conecta la evidencia con métricas y trazas. El perfilado y las trazas distribuidas responden preguntas distintas.
  • El equipo busca una aplicación para investigar: prueba SigNoz junto a una composición de herramientas de Grafana. Compara el despliegue y los permisos completos, incluidos el backend y cualquier dependencia comercial.

Versiones y notas de operación

Métricas — Prometheus, Mimir, VictoriaMetrics y Thanos

El resumen de Prometheus distingue servidor, exportadores y Alertmanager. Su base local de series temporales y sus reglas son útiles sin un servicio distribuido de métricas. Son datos de monitorización, no un registro completo para facturar por petición.

Mimir añade almacenamiento y consulta de métricas a largo plazo con varios inquilinos. VictoriaMetrics ofrece opciones de un nodo y clúster; verifica consultas y replicación en el despliegue elegido. Thanos puede ampliar instalaciones existentes de Prometheus con consultas globales y almacenamiento histórico. Incluye sus componentes en las pruebas de recuperación.

Logs — Loki y OpenSearch

Loki organiza flujos de logs mediante etiquetas; OpenSearch aporta un motor de búsqueda y analítica con campos indexados.

Repite investigaciones reales: servicio e identificador de traza conocidos, texto de error desconocido y una ventana larga. Mide ingesta, almacenamiento de índices o bloques, latencia de consulta y eliminación por retención. Evita conjuntos ilimitados de etiquetas con identificadores de usuario o petición; elige deliberadamente los campos que indexas.

Trazas y perfiles — Tempo, Jaeger y Pyroscope

Tempo y Jaeger permiten trabajar con trazas distribuidas. El límite de licencia de Pyroscope distingue su servidor AGPL de integraciones cliente con sus propios términos.

Sigue una petición lenta a través de reintentos y trabajo asíncrono. Confirma la propagación de contexto y qué spans descarta el muestreo. Para perfiles, mide la sobrecarga en el entorno de ejecución real y comprueba que el periodo capturado incluye el problema investigado.

Colectores — OpenTelemetry Collector y Grafana Alloy

OpenTelemetry Collector recibe, procesa y exporta telemetría. No es el backend de consulta persistente. La disponibilidad y estabilidad de componentes dependen de la distribución y la señal elegidas.

Alloy es una distribución de OpenTelemetry Collector con pipelines de Prometheus e integraciones para logs, trazas y perfiles. Elige por los componentes necesarios y la configuración que el equipo pueda operar. Prueba buffers, reintentos, sobrecarga y eliminación de atributos sensibles antes del envío.

Paneles y alertas — asigna responsables explícitos

Grafana es la interfaz compartida de consulta y visualización en el stack de plataforma del sitio. Un panel no sustituye el almacenamiento de métricas, logs, trazas o perfiles que consulta.

Prometheus evalúa sus reglas; Alertmanager distribuye notificaciones. Las alertas de Grafana también pueden evaluar reglas sobre fuentes compatibles. Define qué sistema controla cada regla, silencio y contacto. Simula una caída del backend y verifica la entrega sin depender de que el panel esté disponible.

Plataformas integradas — compara el despliegue completo

SigNoz reúne la investigación de telemetría en una aplicación. Su licencia usa MIT en el núcleo con excepciones enterprise. Verifica permisos, identidades y retención en la edición que realmente evalúas.

OpenObserve es otra opción orientada a observabilidad, cubierta allí junto al almacenamiento analítico. Compara recolección, almacenamiento e interacción de usuario en conjunto; ver menos servicios no demuestra por sí solo un menor coste operativo.

Una prueba que puede cambiar la decisión

Usa un servicio con una dependencia, un despliegue fallido y un inquilino ruidoso.

  1. Cobertura: detecta errores, latencia y telemetría ausente. Un colector que pierde datos no debe producir un panel engañosamente saludable.
  2. Investigación: sigue una alerta hasta una traza, logs relevantes y un perfil cuando exista. Registra lagunas de evidencia y tiempo de investigación.
  3. Entrega de alertas: interrumpe un backend y un receptor; comprueba reintentos, agrupación, silencios y una señal independiente del fallo.
  4. Recuperación y acceso: restaura configuración y datos retenidos; prueba separación entre inquilinos, atributos depurados y credenciales caducadas.
  5. Coste: mide series activas, cardinalidad de etiquetas, volumen de logs, spans muestreados, sobrecarga de perfiles, retención y esfuerzo con la misma carga.

Sigue los datos

El stack ya distingue observabilidad de plataforma y de LLM con Langfuse, Helicone y Arize Phoenix. Evaluación de modelos, contabilidad de tokens y trazas de prompts añaden otra capa específica de la aplicación; por sí solas no establecen la salud de la infraestructura.

La orquestación y la transformación también necesitan controles de frescura y corrección. BI responde preguntas del negocio, mientras los presupuestos SLO ayudan a convertir objetivos de servicio en decisiones operativas. Elige primero las señales que responden esas preguntas.