스포츠 데이터 분석
스포츠 데이터 분석

같은 슈팅의 xG가 업체마다 다른 이유와 비교하는 법

2026.09.09

같은 슈팅인데도 데이터 업체마다 xG가 다른 가장 큰 이유는 xG가 관측된 정답이 아니라 각 업체의 모델이 계산한 득점 확률이기 때문이에요. 슈팅 위치를 기록하는 방식, 입력 변수, 학습에 사용한 경기와 모델 구조가 다르면 같은 장면도 서로 다른 값이 나옵니다. 어느 한쪽이 곧바로 틀렸다는 뜻은 아니며, 값을 비교하려면 먼저 같은 종류의 지표인지부터 확인해야 해요.

딥블루 배경 위에 하나의 축구 슈팅 장면이 기록 기준, 입력 변수와 학습 표본, 모델 계산의 세 단계를 지나 두 업체의 서로 다른 xG 결과로 갈라지는 청록색 도해

xG는 슈팅에 붙어 있는 고정값이 아니에요

득점과 슈팅 수는 이미 일어난 사건을 세지만, xG는 과거의 비슷한 슈팅이 얼마나 자주 골이 됐는지를 바탕으로 확률을 추정해요. 예를 들어 0.20 xG는 이 슈팅이 반드시 다섯 번 중 한 번 들어간다는 예언이 아니라, 모델이 비슷하다고 판단한 기회들의 평균적인 득점 가능성을 20%로 평가했다는 뜻입니다.

여기서 ‘비슷한 슈팅’의 기준이 업체마다 달라져요. 전통적인 모델은 골문까지의 거리, 슈팅 각도, 머리나 발 같은 신체 부위, 크로스·스루패스 등 직전 행동을 주로 봅니다. 더 많은 장면 정보를 보유한 업체는 골키퍼 위치, 수비수의 차단 정도, 슈터가 받은 압박까지 포함할 수 있어요. 따라서 좌표가 같은 슈팅이라도 모델이 보는 경기 상황은 같지 않을 수 있습니다.

첫 번째 차이는 장면을 기록하는 방식이에요

영상 속 공의 위치를 경기장 좌표로 옮기는 과정부터 차이가 생겨요. 한 업체가 슈팅 지점을 페널티 지역 안쪽으로 기록하고 다른 업체가 선 위나 조금 바깥으로 기록하면 거리와 각도가 달라집니다. 패스가 크로스인지 컷백인지, 슈팅이 헤더인지 다른 부위에 맞은 것인지, 수비 압박이 있었는지 같은 사건 분류도 각 데이터 수집 규칙의 영향을 받아요.

특히 혼전 상황은 작은 기록 차이가 큰 확률 차이로 이어질 수 있어요. 골키퍼가 골문을 비운 장면인지, 수비수가 슈팅 경로를 가리고 있었는지까지 반영하는 모델이라면 단순한 위치 기반 모델보다 상황 변화에 민감합니다. Hudl StatsBomb은 공식 설명에서 골키퍼와 다른 선수들의 위치를 비롯한 프리즈 프레임 정보를 입력에 포함한다고 밝히고 있고, Opta도 골키퍼 위치와 슈터의 시야, 수비 압박 등을 주요 변수로 설명합니다. 다만 두 업체가 같은 방식으로 위치와 압박을 정의한다는 뜻은 아니에요.

딥블루 배경 위에 하나의 축구 슈팅 장면이 기록 기준, 입력 변수와 학습 표본, 모델 계산의 세 단계를 지나 두 업체의 서로 다른 xG 결과로 갈라지는 청록색 도해

입력이 같아 보여도 학습 표본과 계산법이 달라요

업체 A는 여러 남자 프로리그의 장기간 슈팅을, 업체 B는 다른 대회·기간의 자료를 중심으로 학습했을 수 있어요. 리그 수준, 시대별 전술, 남녀 대회 구성처럼 표본의 범위가 달라지면 비슷한 상황의 실제 득점률도 달라질 수 있습니다. Opta는 공식 자료에서 남자와 여자 대회에 별도 모델을 적용한다고 설명해요. 어떤 경기 집단을 기준으로 삼았는지가 확률의 기준선을 바꾸는 사례입니다.

통계 기법도 영향을 줍니다. 로지스틱 회귀, 트리 기반 모델 등은 변수 사이의 관계를 학습하는 방식이 서로 달라요. 같은 데이터라도 변수를 구간으로 나누는 법, 희귀한 상황을 별도 처리하는 법, 확률을 보정하는 법에 따라 결과가 달라집니다. 모델은 새 데이터나 설계 개선에 맞춰 개정되기도 하므로, 같은 업체의 과거 게시물과 현재 화면이 반드시 같은 버전의 값을 쓰는지도 확인할 필요가 있어요.

가상의 컷백 장면으로 차이를 풀어볼게요

공격수가 골대 정면 가까이에서 오른발로 컷백을 슈팅한 가상 장면을 생각해 보세요. 업체 A가 위치·각도·신체 부위·패스 유형만 사용한다면 가까운 중앙 슈팅이라는 점에 큰 비중을 둘 수 있어요. 업체 B가 여기에 골키퍼가 이미 슈팅 방향을 막았고 두 수비수가 골문 일부를 가렸다는 정보를 더하면 더 낮은 확률을 낼 수 있습니다. 반대로 골키퍼가 넘어져 있거나 골문에서 멀리 벗어난 것으로 기록됐다면 업체 B의 값이 더 높아질 수도 있어요.

이 예시는 원리를 보여주기 위한 것이므로 특정 수치를 붙이지 않는 편이 정확합니다. 실제 모델의 세부 가중치는 대부분 완전히 공개되지 않고, 한 장면만 보고 차이가 어느 변수에서 얼마나 발생했는지 역산하기도 어렵기 때문이에요. 중요한 것은 두 숫자의 크기만 보고 우열을 정하지 않고, 각 모델이 이용할 수 있었던 정보의 범위를 살피는 것입니다.

비교 전에는 네 가지를 확인해요

먼저 둘 다 슈팅 이전 상황을 평가하는 일반 xG인지 확인하세요. 슈팅이 골문 어느 지점으로 향했는지까지 반영하는 xGOT나 포스트샷 xG는 실행 결과를 포함하므로 일반 xG와 직접 비교하면 안 됩니다. Opta의 공식 설명에서도 xGOT는 기존 xG와 슈팅의 골문 도착 위치를 함께 사용하는 별도 지표로 정의돼요.

다음으로 페널티와 자책골의 포함 여부, 리바운드 처리, 표시 자릿수를 봐야 해요. 화면에는 0.1로 같아 보여도 내부 값은 다를 수 있고, 반대로 개별 슈팅의 작은 차이가 여러 슈팅을 더한 팀 xG에서 누적될 수 있습니다. 마지막으로 제공업체 이름, 모델 또는 데이터 버전, 조회 날짜를 함께 적어 두세요. 경기 분석에서는 한 업체의 값을 일관되게 사용하고, 교차 비교가 필요하면 ‘Opta 기준’처럼 출처를 분명히 밝히는 것이 가장 실용적입니다.

xG 차이는 오류를 찾는 문제라기보다 서로 다른 측정 도구의 설계를 읽는 문제에 가까워요. 다음에 두 서비스의 경기 xG가 다르게 보이면 개별 슈팅 지도를 열어 차이가 큰 장면을 찾고, 지표 종류와 입력 변수, 사건 분류, 모델 버전 순서로 점검해 보세요. 한 경기의 작은 차이를 승패의 정답처럼 해석하기보다 같은 출처로 여러 경기의 기회 창출 흐름을 비교할 때 xG의 장점이 더 잘 드러납니다.

이 블로그의 다음 이야기도 받아보세요

새 글 구독 (RSS)