Inicio / Blog / Observabilidad práctica
Fiabilidad y operaciones backend

Observabilidad con presupuesto ajustado: logs, métricas, trazas y alertas

Un backend pequeño no necesita una plataforma de telemetría corporativa para responder preguntas básicas de producción. Sí necesita saber si el usuario termina una operación, dónde falló una solicitud y si una cola se está retrasando. Empieza con pocas señales de alto valor, relaciónalas mediante un ID de correlación y añade detalle cuando los incidentes revelen una carencia. El presupuesto incluye atención operativa, almacenamiento y cardinalidad, no solo la factura del proveedor.

Parte de preguntas operativas

Cada señal responde a una pregunta distinta
Métricas¿Cuántos, con qué frecuencia y cuánto tardan?
Trazas¿Dónde pasó el tiempo de la solicitud?
Logs¿Qué ocurrió en este paso concreto?
Alertas¿Alguien debe actuar ahora?
FlujoSeñales inicialesAlerta accionable
API HTTPVolumen, errores y percentiles de latenciaFallos persistentes que afectan al usuario
JobsAntigüedad de cola, intentos y fallosEl trabajo más antiguo supera su plazo
IntegracionesLatencia externa, throttling y frescuraDatos críticos desactualizados más allá del acuerdo
Base de datosConexiones, consultas y espera del poolLas solicitudes no obtienen conexión y se degradan

Correlaciona sin registrar todo

Usa logs estructurados con hora, servicio, entorno, severidad, operación e ID de traza. Añade IDs de entidades solo si son seguros y útiles; nunca registres tokens, contraseñas, cuerpos completos ni datos sensibles. La correlación permite pasar de una métrica agregada a una traza y luego a unos pocos eventos relevantes.

Instrumenta primero las fronteras: solicitud, base de datos, API externa, publicación en cola y ejecución del worker. La instrumentación automática de OpenTelemetry cubre librerías comunes; añade spans para operaciones de negocio, no para cada línea. Muestrea trazas exitosas de alto volumen y conserva errores y lentitud según la política.

Controla cardinalidad y coste

Las métricas muestran tendencias, pero cada combinación única de labels consume estado y almacenamiento. Evita IDs de usuario, URLs sin normalizar, mensajes de error arbitrarios e IDs ilimitados de clientes. Prefiere rutas normalizadas, clase de estado, operación, servicio y entorno. Deja los detalles de cardinalidad alta en trazas muestreadas o logs consultables.

Alerta sobre síntomas

Una alerta urgente debe significar que alguien tiene que actuar. Usa fallos persistentes visibles para usuarios, latencia, plazos de procesamiento incumplidos o consumo del presupuesto SLO. Envía avisos menores a tickets o paneles. Incluye flujo afectado, valor, ventana, responsable y runbook. Un período mínimo evita alertas por picos breves; prueba toda la ruta de notificación.

Define retención y muestreo

Conserva poco tiempo los logs de depuración, aplica una política propia a auditoría y muestrea trazas rutinarias. La retención debe equilibrar investigación y sensibilidad. Revisa el volumen después de instrumentar: un campo ruidoso puede dominar el gasto. Establece límites de bytes, trazas y alertas y elimina señales que nadie consulta.

En resumen

La observabilidad económica es selectiva, correlacionada y ligada a decisiones. Mide resultados del usuario, usa trazas para localizar latencia, logs para eventos concretos y alerta solo cuando hace falta actuar. Limita labels, protege datos, define retención y confirma que cada señal justifica su coste.

Referencias