데이터 팀이 활용할 수 있는 텔레메트리 데이터는 그 어느 때보다 많아졌지만, 인시던트 조사 속도는 그에 비해 빨라지지는 않았습니다. 많은 조직은 자연스럽게 AI가 해결책이라고 판단하고 AI 계층을 추가한 뒤 이를 AI SRE(AI Site Reliability Engineering)이라고 부르기 시작했습니다.
그러나 조직과 고객의 안정성 요구를 충족하려는 이러한 움직임이 너무 빠르게 진행되면서, 대부분의 AI 기반 옵저버빌리티는 AI를 지원하도록 설계되지 않은 기존 아키텍처에 AI 기능만 덧붙인 형태에 머물러 있습니다. 이러한 방식은 빠르게 결과를 제공할 수는 있지만, 도구가 데이터 플랫폼과 긴밀하게 통합되어 있지 않기 때문에 중요한 정보가 누락되는 경우가 많습니다. 이는 효율적이지도 효과적이지도 않습니다.
이 글에서는 실제로 인시던트 조사 속도와 정확도를 높이는 AI SRE 도구와, 단순히 텔레메트리 데이터를 요약하는 수준에 머무는 AI SRE를 구분하는 핵심 요소를 살펴봅니다.
먼저, 효과적인 AI SRE가 어떤 모습인지 이해하려면, 현재의 조사 방식이 실제로 얼마나 많은 비용을 발생시키고 있는지 살펴보겠습니다.
인시던트 조사가 엔지니어링 생산성에 미치는 영향
Observe by Snowflake 고객으로부터 수집한 정보에 따르면, 복잡한 인시던트의 조사 기준은 감지에 10분, 조사에 120분, 수정에 15분, 근본 원인 분석에 370분이 소요되며 완료율은 30%에 불과합니다.1 수백 명의 온콜 엔지니어가 여러 도구를 사용하여 문제를 연결하고, 사용자 지정 쿼리를 작성하며 이벤트 체인을 조합해 문제를 파악해야 합니다.

이는 Observe에만 해당되는 것이 아닙니다. 옵저버빌리티 업계 전반에서 현대적인 분산 시스템이 생성하는 텔레메트리가 기하급수적으로 증가하면서 모두가 해결해야 할 과제가 생겼습니다. 엔지니어링 팀은 알림을 처리하지 못하고 중요한 신호를 놓치고 있으며, 그 결과 인시던트를 해결하는 데 더 오랜 시간이 걸리고 있습니다. 적당히 복잡한 인시던트라도 문제를 찾고 조사 프로세스를 완료하려면 여러 단계를 거쳐야 합니다.
조사가 어려워진 이유는 구조적인 문제에 있습니다.
데이터 볼륨이 레거시 옵저버빌리티 플랫폼의 처리 역량을 넘어섰습니다.
마이크로서비스와 상호 연결된 시스템이 증가하면서 시스템 간 종속성이 더욱 복잡해졌습니다.
또한 근본 원인 분석 전문성이 소수의 엔지니어에게 집중되어 있습니다.
트레이스 계층을 탐색하고, 여러 시간 구간에 걸쳐 로그를 분석하며, 서비스 전반의 결과를 종합하는 실제 조사 작업은 쉽게 자동화할 수 없습니다.
복잡한 시스템을 운영하는 조직에서는 인시던트 대응과 그 여파로 인해 상당한 엔지니어링 역량이 소모될 수 있습니다. 대부분의 팀은 해결책으로 AI SRE를 선택하지만, 모든 AI SRE가 같은 방식으로 작동하는 것은 아닙니다.
AI SRE는 정확하고 지연 시간이 짧으며 비용 효율적이어야 합니다.
AI SRE가 간단한 자연어 쿼리에 얼마나 잘 응답하는지만으로는 옵저버빌리티 도구로서의 가치를 판단할 수는 없습니다. 더 근본적인 질문은 데이터 파운데이션이 구현된 AI SRE를 뒷받침해 실제로 유용하게 만들 수 있는지 여부입니다.
옵저버빌리티 AI SRE는 텔레메트리 데이터나 다른 옵저버빌리티 도구 위에 얹은 단순한 채팅 기능 그 이상이어야 합니다. 신뢰할 수 있을 만큼 정확하고, 활성 상태인 인시던트 중에도 사용할 수 있을 만큼 빠르며, 비용이 누적되지 않도록 쿼리할 수 있을 만큼 효율적이어야 합니다.
현재 제공되는 대부분의 AI SRE는 기본 쿼리에 빠르게 응답하도록 설계되었을 뿐, 빠르게 변화하는 복잡한 옵저버빌리티 워크로드를 자율적으로 운영하도록 설계되지 않았기 때문에 기대에 미치지 못합니다.
효과적인 AI SRE를 위한 3가지 필수 조건
어떤 AI SRE를 사용할지 결정하기 전에 먼저 AI SRE를 지원할 적절한 데이터 파운데이션이 마련되어 있는지 확인해야 합니다.
모든 텔레메트리가 한곳에 모여 있습니까, 아니면 도구별로 사일로화되어 있습니까?
원하는 보존 기간 동안 샘플링 없이 필요한 데이터를 보관할 수 있을 만큼 스토리지 계층이 비용 효율적입니까?
시스템이 인프라, 애플리케이션, 서비스, 비즈니스 데이터 간의 관계를 모델링합니까?
AI SRE 도구에 관한 대부분의 논의는 최상위 계층에서 시작하지만, 이는 올바른 출발점이 아닙니다. 효과적인 AI 기반 조사를 위해서는 3개 계층이 함께 작동해야 하며, AI 계층의 정확도는 그 기반이 되는 요소의 품질을 넘을 수 없습니다.
계층 1: 통합되고 비용 효율적인 텔레메트리 스토리지: AI 계층이 처리할 수 있는 데이터가 많을수록 결과는 더 정확해집니다. 이를 위해서는 두 가지가 함께 갖춰져야 합니다. 로그, 메트릭, 트레이스를 통합 저장할 수 있는 환경과, 대규모 데이터를 유지하면서도 비용 때문에 타협하지 않아도 되는 수준의 경제적인 스토리지입니다.
계층 2: 시맨틱 관계를 모델링하는 컨텍스트 그래프: 원시 텔레메트리는 인시던트에 관한 일부 인사이트를 제공할 수 있지만, 컨텍스트 그래프는 인시던트가 발생한 이유와 다른 어떤 요소와 연결되는지 설명합니다. 컨텍스트 그래프는 환경의 다양한 오브젝트 간 시맨틱 관계를 모델링합니다. 따라서 AI 계층이 연관된 단서를 따라갈 때 서로 다른 엔터티가 어떻게 연결되는지 보여주는 지도를 따라가며 분석할 수 있습니다.
계층 3: 기초 데이터와 시맨틱 기반을 활용할 수 있는 AI SRE: AI SRE는 1계층과 2계층을 기반으로 하며, 통합된 스토리지와 컨텍스트를 활용할 수 있도록 에이전트에 최적화된 인터페이스를 사용합니다. 에이전트에 최적화된 인터페이스를 통해 쿼리를 실행하는 에이전트는 AI 액세스를 고려하지 않고 설계된 플랫폼에 쿼리를 보내는 에이전트보다 더 정확한 결과를 더 짧은 지연 시간과 낮은 오버헤드로 제공합니다.
에이전트를 고려해 설계된 Observe by Snowflake
Observe by Snowflake는 세 가지 계층을 함께 구성합니다. 데이터 레이크하우스는 높은 충실도와 낮은 비용으로 로그, 지표, 트레이스를 저장합니다. 컨텍스트 그래프는 다양한 소스의 컨텍스트(비즈니스, 애플리케이션, 인프라 등)를 활용해 해당 데이터를 구조화합니다. AI SRE는 이 두 계층 위에서 작동하며, 처음부터 다른 계층과 함께 작동하도록 설계되었습니다. 그 결과, 여러 Observe 고객이 최대 10배 더 빠르게 문제를 해결할 수 있었습니다(평균 4배 이상).2 실제로는 어떤 모습인지 살펴보겠습니다.

조사 루프는 여전히 AI가 담당하지만, 속도는 크게 향상됩니다. 이제 이러한 작업을 기존보다 훨씬 짧은 시간 안에 완료할 수 있습니다. 또한 AI는 소수의 전문가뿐 아니라 모든 사용자가 이 프로세스를 수행할 수 있도록 지원합니다.
Anthropic의 AI 생산성 측정 프레임워크 기반 방법론을 사용해 수동 조사 시간과 AI 지원 완료 시간을 비교한 결과, AI 지원을 통해 다음과 같은 효과를 확인했습니다.
- 생산성 향상은 일관되게 3배~10배 범위에 집중되었습니다.
- 상호작용의 30%가 5배 이상의 개선을 보였습니다.
- 상호작용의 5%에서는 10배 이상의 개선이 나타났습니다.
가장 큰 향상은 여러 소스에 걸친 대규모 데이터를 신속하게 종합해야 하는 조사에서 나타났습니다. 통합 텔레메트리와 컨텍스트 그래프는 이러한 영역에서 조사 시간을 줄이는 데 기여할 수 있습니다.

이러한 개선 효과는 연구 결과뿐 아니라 고객들의 실제 피드백을 통해서도 확인되고 있습니다.
위치 인텔리전스 기업: Observe의 AI SRE는 해당 기업의 엔지니어링 팀 전반에서 인시던트 대응을 개선하는 데 기여했습니다. 이 기업은 Observe의 AI SRE와 MCP Server가 인시던트를 조사하는 방식을 근본적으로 바꿀 수 있다고 평가했습니다. 또한 이러한 기능은 엔지니어가 문제를 해결하는 데 소요하는 시간을 줄이는 데도 도움이 되었습니다.
스포츠 및 엔터테인먼트 운영 기업: 이 기업이 얻은 가치는 더 빠른 조사에 그치지 않고 사전 예방적 안정성 확보로 이어졌으며, Observe가 팀의 시스템 문제 감지 역량을 강화해 시스템 안정성을 높이는 데 기여했다고 밝혔습니다.
자동차 SaaS 공급자: 인시던트 조사 시간이 3시간 이상에서 수분으로 단축되면서 고객 경험이 직접적으로 개선되었습니다. 이 공급자는 여러 팀에서 일관된 피드백을 받았습니다. 에스컬레이션은 줄고, 지원 티켓 해결 속도는 빨라졌으며, 전반적인 수작업 검토 시간도 감소했습니다.
모든 사례에서 이러한 차이를 만든 것은 AI 계층이 완전한 텔레메트리와 컨텍스트를 활용할 수 있었기 때문입니다. 이러한 결과는 기본 아키텍처가 AI SRE 계층을 지원할 때 무엇이 가능한지를 보여줍니다.
AI SRE의 성과를 좌우하는 아키텍처
AI SRE 솔루션을 평가할 때는 기본 아키텍처와 관련해 다음 세 가지 질문을 확인해야 합니다.
AI SRE가 모든 텔레메트리 데이터에 통합 액세스할 수 있습니까?
AI SRE가 서비스, 배포, 사용자와 비즈니스 컨텍스트 간의 관계를 이해합니까?
AI SRE가 기본 계층을 활용하도록 최적화되어 있습니까, 아니면 단순히 그 위에 올라가 있을 뿐입니까?
이 질문에 대한 답에 따라 AI SRE가 조사를 가속할 수 있는지, 아니면 텔레메트리용 채팅 인터페이스만 제공하는지가 결정됩니다.
8월에 진행된 Observe의 에이전트 중심 옵저버빌리티 웨비나 온디맨드 동영상을 통해 대규모 옵저버빌리티에 대해 자세히 알아보세요.
1 “What's New: Observe by Snowflake를 활용한 대규모 AI 기반 옵저버빌리티”, Snowflake Summit 2026, 세션 WN201B.
2 2025년 10월부터 11월까지 Observe가 3,163개의 AI SRE 대화 구간을 분석한 결과를 기반으로 합니다.

