Capacidade de entender o estado interno de sistemas complexos através de métricas, logs e traces distribuídos.
Observabilidade vai além do monitoramento tradicional: permite responder perguntas novas sobre o sistema sem alterar código, com base em três pilares — métricas (Prometheus, OpenTelemetry), logs estruturados (Loki, Elastic, OpenSearch) e traces distribuídos (Jaeger, Tempo, Honeycomb). Em 2026, adicionam-se profiling contínuo (Pyroscope, Parca) e eventos. OpenTelemetry consolidou-se como padrão de coleta vendor-neutral. Plataformas líderes: Datadog, New Relic, Grafana Cloud, Dynatrace, Splunk Observability. SLOs e error budgets orientam priorização. Para sistemas com IA, surge a observabilidade de LLMs (LangSmith, Arize, Helicone) cobrindo prompts, custos, latência e qualidade. A Nobug implementa stacks de observabilidade integradas a SOC e Platform Engineering.