구글에서 왔다는 요청 3만 4천 건 중 사람은 19건이었다

구글에서 왔다는 요청 3만 4천 건 중 사람은 19건이었다

접속 기록에는 방문자가 어디서 왔는지 적는 칸이 있습니다. Referer 라고 부릅니다. 여기에 https://www.google.com/이 적혀 있으면 보통 구글 검색 결과를 눌러서 들어온 사람이라고 읽습니다. 유입 통계라는 것이 대개 이 칸을 세어서 만들어집니다.

이 서버의 8일치 기록에서 그 칸에 검색엔진이 적힌 요청이 34,446건이었습니다. 숫자만 보면 하루 4,300건, 검색에서 들어온 방문으로 읽힙니다. 그런데 Referer 를 보지 않는 네 가지를 대 보니 사람일 수 있는 것은 19건이었습니다. 0.06%입니다.

기록은 구글이라고 말합니다

먼저 그 칸에 적힌 주소를 그대로 세어 보았습니다. 아무 의심 없이 집계하면 이런 보고서가 나옵니다.

적혀 있던 주소 요청
www.google.com 33,814
m.baidu.com 220
duckduckgo.com 127
www.bing.com 112
google.com 60
yandex.ru 55
www.baidu.com 49
www.google.com.hk 6
www.google.co.uk 2
search.naver.com 1
합계 34,446

98.4%가 구글입니다. 네이버는 1건입니다. 한국어 사이트가 올라가 있는 서버인데 국내 검색엔진이 1건이라는 것부터 이상합니다.

네 가지를 대 보았습니다

Referer 는 서버가 알아낸 값이 아닙니다. 요청을 보내는 쪽이 적어서 보내는 값입니다. 그러니까 거짓으로 적어도 서버는 그대로 받아 적습니다. 믿을 수 있는지 보려면 같은 요청의 다른 부분과 맞춰 봐야 합니다.

96.4%가 검색 결과에 실릴 수 없는 주소였습니다

요청한 경로를 분류했습니다.

요청 경로 건수
게시판 목록·정렬 URL 32,547
그 외 1,306
xmlrpc.php 224
홈 141
설정·백업 파일 탐색 106
워드프레스 디렉터리 탐색 102
wp-login.php 14
REST API 5
글 본문 1

구글에서 왔다면서 xmlrpc.php로 간 요청이 224건입니다. 이 주소는 사람이 읽는 화면이 아니고 검색 결과에 실리지도 않습니다. 설정 파일과 백업 파일을 찾는 요청도 106건 섞여 있습니다. 로그인 창으로 간 것이 14건입니다.

가장 많은 32,547건은 게시판 주소인데, 전체 요청의 96.4%에 물음표 뒤 조건이 붙어 있었습니다. 정렬 기준과 페이지 번호를 바꿔 가며 붙인 주소입니다. 검색 결과에 실리는 것은 글 하나의 깔끔한 주소이고, 이런 주소는 목록을 차례로 걸어 다닐 때 생깁니다. 글 본문으로 간 요청은 34,446건 중 1건이었습니다.

요청의 96.0%가 한 대역에서 왔습니다

보낸 쪽의 주소를 큰 덩어리로 묶어 보았습니다.

34,446건 중 33,085건, 즉 96.0%가 47.79.0.0/16 하나에서 나왔습니다. 그 안에서도 /24 일곱 덩어리에 모여 있습니다. 전국의 집과 휴대폰에서 검색을 눌러 들어온 사람들이라면 주소가 이렇게 뭉치지 않습니다. 이 대역의 주소 몇 개를 역방향으로 조회해 보니 이름이 등록되어 있지 않았습니다. 개인 회선에는 보통 통신사 이름이 붙습니다.

IP 하나가 평균 44.7건을 보냈습니다. 검색으로 들어온 사람이 한 번에 44쪽을 읽고 나가지는 않습니다.

23시간이 시간당 469건으로 같았습니다

가장 요청이 많던 10월 8일을 시간 단위로 끊었습니다. 자정 한 시간은 기록 파일이 갈리는 경계라 빼고 23시간을 보았습니다.

시간당 최소 435건, 최대 553건, 평균 469건이었습니다. 가장 많은 시간과 가장 적은 시간의 차이가 1.27배입니다. 사람이 만드는 트래픽은 새벽에 비고 저녁에 몰려서 하루 안에서 몇 배씩 출렁입니다. 23시간을 1.27배 안에서 일정하게 채우는 것은 시간을 보지 않는 쪽입니다.

자산을 받아 간 IP 는 9.0%였습니다

브라우저는 페이지를 받으면 거기 딸린 CSS 와 자바스크립트와 이미지를 이어서 받아 갑니다. 화면을 그려야 하니 안 받을 수가 없습니다. 반대로 본문만 긁어 가는 쪽은 이것을 받지 않습니다. 이 서버에 실제로 사람이 다녀간 경우와 비교해 보았습니다.

구분 IP 자산도 받아 간 IP 비율
검색엔진이 적혀 있던 요청 770 69 9.0%
내 블로그 두 곳을 본 쪽 702 287 40.9%

구글에서 왔다는 쪽은 열에 하나만 화면을 그렸습니다. 나머지 아홉은 HTML 만 받아 가고 끝냈습니다.

남은 것은 19건입니다

앞의 관찰을 조건으로 바꿔 차례로 걸렀습니다. 어느 것도 Referer 를 보지 않습니다.

조건 남은 요청 비율
검색엔진이 적혀 있던 요청 전체 34,446 100%
자산도 받아 간 IP 만 504 1.46%
+ IP 당 요청이 10건 이하 145 0.42%
+ 물음표 뒤 조건이 없는 주소 19 0.06%
검색엔진이 적혀 있던 요청 34,446건을 조건으로 거른 막대그래프. 전체 34,446건, 자산도 받은 IP 만 504건, IP당 10건 이하 145건, 정렬 조건 없는 주소 19건
자산을 받아 갔는지만 봐도 98.5%가 떨어집니다.

자산을 받았는지만 봐도 98.5%가 떨어집니다. 19건이 전부 사람이라는 뜻도 아닙니다. 사람일 가능성을 아직 배제하지 못한 것이 19건이라는 뜻입니다.

내 블로그의 검색 유입은 0건입니다

이 서버에는 사이트가 여러 개 올라가 있고 접속 기록이 한 파일에 섞입니다. 위 숫자는 서버 전체의 합입니다. 그래서 제 블로그 두 곳만 따로 떼어 보았습니다. 자산 요청에 적힌 Referer 로 어느 사이트의 어느 페이지였는지 되짚는 방식입니다.

8일 동안 두 사이트에 들어온 검색 유입은 0건이었습니다. 34,446건은 전부 다른 몫이었습니다. 통계를 Referer 로 만들었다면 저는 하루 4,300명이 검색으로 찾아온다고 적어 두었을 것입니다. 실제로는 한 명도 없었습니다.

전에 자주 보는 보안 조언을 제 서버 기록에 대 보았을 때도, 막은 뒤에 스캐너가 줄었는지 다시 세어 보았을 때도 같은 일이 있었습니다. 맞는 말처럼 보이는 것이 제 서버에서는 틀렸습니다. 재 보기 전까지는 어느 쪽인지 알 수 없습니다.

어떻게 쟀는가

아파치의 접속 기록을 combined 형식 그대로 읽었습니다. 2026년 10월 4일부터 11일 낮까지 8일치, 1,961,465줄입니다. 집계는 2026년 10월 11일 12시 16분(서버 시간) 한 번의 읽기로 끝냈습니다. 기록 파일은 계속 자라므로 항목마다 따로 돌리면 숫자가 어긋납니다.

Referer 칸에서 호스트만 떼어 내 검색엔진 이름이 들어간 것을 골랐습니다. 이미지와 CSS 처럼 페이지에 딸려 오는 요청은 사람 한 명을 여러 번 세게 되므로 빼고 셌습니다. 같은 Referer 를 단 자산 요청 613건이 여기서 제외되었습니다.

IP 를 세는 것과 요청을 세는 것을 섞지 않으려고, 자산 수신 여부와 IP 당 요청 수는 IP 단위로 먼저 구한 뒤 요청에 되붙였습니다.

다시 잴 것

이 서버의 xmlrpc.php는 측정을 마친 뒤 닫았습니다. 그 224건이 어디로 가는지가 다음 질문입니다. 403 을 받고 멈추는지, 다른 경로로 옮겨 가는지, 아니면 Referer 만 바꿔서 다시 오는지 7일 뒤 같은 방법으로 세어 비교하겠습니다.

47.79.0.0/16 을 막는 실험은 아직 하지 않았습니다. 막으면 요청이 줄 것은 분명하고, 알고 싶은 것은 그게 아니라 같은 쪽이 다른 대역으로 옮겨 오는지입니다. 그것도 같이 재겠습니다.

자주 묻는 것

Referer 를 못 적게 막으면 되지 않나요

막을 수 있는 쪽이 아닙니다. 이 칸은 서버가 알아내는 값이 아니고 요청을 보내는 쪽이 적어서 보내는 값입니다. 내 서버 설정으로 남의 요청에 적힌 글자를 바꿀 수는 없습니다. 바꿀 수 있는 것은 그 글자를 얼마나 믿을지입니다. 이 글의 네 가지는 모두 Referer 를 보지 않고 판단합니다.

게시판 요청 32,547건이 진짜 검색 유입일 가능성은 없나요

처음에는 그 가능성을 먼저 의심했습니다. 응답 코드가 200 이고 실제 게시판 주소여서, 다른 사이트가 받는 정상 유입일 수 있었습니다. 그래서 네 가지를 댄 것입니다. 한 대역에 96.0%가 모여 있고, 23시간이 1.27배 안에서 일정하고, 열에 아홉이 화면을 그리지 않고, 96.4%가 정렬 조건이 붙은 주소였습니다. 하나만으로는 약하지만 네 개가 같은 방향을 가리켰습니다.

그러면 유입은 무엇으로 봐야 하나요

검색엔진이 직접 알려 주는 쪽이 낫습니다. 서치 콘솔과 서치어드바이저는 자기 쪽에서 센 노출과 클릭을 줍니다. 요청을 보낸 쪽이 적어 준 글자가 아닙니다. 서버 기록으로 봐야 한다면 자산을 함께 받아 갔는지를 같이 보십시오. 이 측정에서 그 조건 하나가 98.5%를 걸러 냈습니다.

Similar Posts

답글 남기기

이메일 주소는 공개되지 않습니다. 필수 필드는 *로 표시됩니다