{"version":"0.2.0","built_at":"2026-10-10T20:58:14.188Z","license":"CC BY 4.0 © Mike Reams","canonical":"https://catalog.mikereams.com","capability":{"id":"BC-1230","name":"Site Reliability","level":1,"parent_id":null,"l1_id":"BC-1230","industry":"software","macro_id":null,"path":["Site Reliability"],"description":"Keep the product available and performant to the level promised to customers, detect when it is not before they do, restore it quickly, and learn from every failure. This is reliability of the product the company sells, not of the systems employees use.","aliases":["SRE","Production Operations","Service Reliability","Product Operations Engineering"],"in_scope":["Service level objectives, error budgets and the decisions they drive","Observability of production — metrics, logs, traces and alerting","Incident response for the product, on-call, and blameless postmortems","Resilience engineering, capacity under load and disaster recovery for the product"],"out_of_scope":["Incident and problem management for internal IT services (see BC-740)","Corporate infrastructure operations (see BC-730)","Enterprise-wide business continuity planning (see BC-830)"],"csdm_note":"Maps to the operational side of each product Application Service and its Service Offerings, where availability commitments live; incident records should attach to the Application Service, not the team.","status":"active","successor_id":null,"child_ids":["BC-1230.10","BC-1230.20","BC-1230.30","BC-1230.40","BC-1230.50"]},"crosswalk":{"realized_by":[],"used_in":[{"vs_id":"VS-100","vs":"Commit-to-Production","stage_id":"VS-100.40","stage":"Release Progressively","order":4,"via":"BC-1230.20"},{"vs_id":"VS-100","vs":"Commit-to-Production","stage_id":"VS-100.50","stage":"Operate & Observe","order":5,"via":"BC-1230.10"}],"patterns":[{"id":"DP-010","name":"Circuit Breaker","category":"Resilience","via":null},{"id":"DP-020","name":"Retry with Backoff","category":"Resilience","via":null},{"id":"DP-030","name":"Bulkhead","category":"Resilience","via":"BC-1230.40"},{"id":"DP-050","name":"Throttling","category":"Resilience","via":"BC-1230.40"},{"id":"DP-380","name":"Canary Release","category":"Deployment","via":"BC-1230.20.20"},{"id":"DP-450","name":"Distributed Tracing","category":"Observability","via":"BC-1230.20.10"},{"id":"DP-460","name":"Structured Logging","category":"Observability","via":"BC-1230.20.10"},{"id":"DP-470","name":"SLO and Error Budget","category":"Observability","via":"BC-1230.10"}],"stacks":[{"id":"TS-070","name":"Open observability stack","layer":"Observability","via":"BC-1230.20"}],"books":[{"id":"BK-release-it","title":"Release It!","topic":"Distributed systems","via":null},{"id":"BK-building-microservices","title":"Building Microservices","topic":"Distributed systems","via":"BC-1230.40"},{"id":"BK-the-art-of-scalability","title":"The Art of Scalability","topic":"Distributed systems","via":"BC-1230.40"},{"id":"BK-observability-engineering","title":"Observability Engineering","topic":"Cloud & infrastructure","via":"BC-1230.20"},{"id":"BK-site-reliability-engineering","title":"Site Reliability Engineering","topic":"Delivery & DevOps","via":"BC-1230.10"},{"id":"BK-chaos-engineering","title":"Chaos Engineering","topic":"Delivery & DevOps","via":"BC-1230.40"},{"id":"BK-building-secure-and-reliable-systems","title":"Building Secure and Reliable Systems","topic":"Security","via":"BC-1230.50"}]},"ancestors":[],"children":[{"id":"BC-1230.10","name":"Service Level Management","level":2,"child_count":3},{"id":"BC-1230.20","name":"Observability","level":2,"child_count":4},{"id":"BC-1230.30","name":"Incident Response","level":2,"child_count":4},{"id":"BC-1230.40","name":"Resilience & Capacity Engineering","level":2,"child_count":4},{"id":"BC-1230.50","name":"Operational Readiness","level":2,"child_count":3}]}