본문 바로가기
무료 상담
구글

robots.txt로 막았는데 검색에 뜹니다 — noindex와 크롤링 차단의 차이

철망 울타리 앞에 세워진 빨간 진입금지 표지판

"이 페이지는 검색에 안 나오게 해 주세요"라는 요청을 받으면 대부분 robots.txt에 Disallow를 씁니다. 그런데 그게 정확히 반대 결과를 만드는 경우가 있습니다. robots.txt는 크롤링을 막는 장치이고, 검색 결과에서 빼는 것은 noindex입니다. 둘을 같이 쓰면 noindex가 읽히지 않아 주소만 검색 결과에 남습니다.

두 가지는 서로 다른 층위입니다

  • robots.txt Disallow — "이 경로를 가져가지 마세요". 크롤러가 페이지 본문을 안 읽습니다
  • noindex — "가져가되 검색 결과에는 넣지 마세요". 메타 태그 또는 X-Robots-Tag 헤더로 지정합니다

여기서 문제가 생깁니다. noindex는 페이지를 읽어야 알 수 있는 지시입니다. robots.txt로 크롤링을 막아 두면 크롤러는 그 페이지의 meta 태그를 볼 수 없고, 결과적으로 noindex를 영원히 모릅니다. 그 상태에서 외부 링크가 하나라도 걸려 있으면 제목 없이 URL만 검색 결과에 등록될 수 있습니다.

상황별로 무엇을 쓰나

  • 검색 결과에서 빼고 싶다noindex. robots.txt는 건드리지 않습니다
  • 크롤링 예산을 아끼고 싶다(끝없는 필터 조합 URL 등) → robots.txt Disallow
  • 이미 색인된 페이지를 빼고 싶다 → 먼저 noindex로 두고 재크롤링을 기다립니다. 색인에서 빠진 것을 확인한 뒤에야 robots.txt로 막습니다. 순서를 바꾸면 안 빠집니다
  • 파일(PDF·이미지)을 빼고 싶다 → meta 태그를 넣을 수 없으므로 X-Robots-Tag 헤더를 씁니다
  • 로그인 뒤 페이지 → 접근 제어가 우선입니다. 스테이징 사이트도 마찬가지로 인증으로 막는 것이 가장 확실합니다

실무에서 가장 자주 보는 세 가지 실수

첫째, Disallow와 noindex 동시 사용. 위에서 설명한 그 조합입니다. 의도는 강하게 막는 것이었지만 결과는 반대입니다.

둘째, robots.txt로 CSS·JS 차단. 예전 관행이 남아 있는 사이트가 아직 있습니다. 렌더링에 필요한 자원을 막으면 구글이 페이지를 사용자와 다르게 보게 되고, 모바일 사용성과 레이아웃 평가에 영향을 줍니다. 자원 차단은 해제하는 것이 기본값입니다.

셋째, 스테이징에 걸어 둔 전체 차단을 그대로 배포. Disallow: / 한 줄이 실서버로 넘어가면 사이트 전체가 크롤링에서 사라집니다. 배포 체크리스트에 robots.txt 확인을 넣어 두십시오. 색인이 안 되는 원인을 추적하는 순서는 사이트맵과 색인 편에 있습니다.

확인 방법 — 브라우저로 보는 것만으로는 부족합니다

robots.txt는 요청자에 따라 다른 내용을 반환하도록 설정될 수 있습니다. CDN이나 보안 규칙이 붙어 있으면 사람이 브라우저로 볼 때와 크롤러가 볼 때가 다를 수 있습니다. 그래서 확인은 검색엔진 크롤러의 UA로 요청해 보는 것이 정확합니다.

서치콘솔의 URL 검사에서 "페이지를 가져올 수 있음/색인 생성 가능 여부"를 함께 보면 실제 판정이 나옵니다. CDN 설정이 검색에 영향을 주는 다른 항목은 Cloudflare 점검 편에 정리해 두었습니다.

색인을 빼는 데 걸리는 시간

noindex를 걸어도 즉시 사라지지 않습니다. 그 페이지가 다시 크롤링되어야 반영됩니다. 방문이 적은 페이지는 몇 주가 걸리기도 합니다.

급한 경우 서치콘솔의 삭제 도구로 일시적으로 가릴 수 있습니다. 다만 이건 약 6개월짜리 임시 조치이므로, 근본 처리는 noindex(또는 페이지 삭제 후 404/410)여야 합니다. 오래된 주소를 정리할 때의 판단은 301 실무 순서를 참고하십시오.

정리 — 한 문장 규칙

"검색 결과에서 빼려면 크롤링을 허용해야 한다." 역설적으로 들리지만 이 한 줄이 핵심입니다. 막는 것과 빼는 것은 다른 일이고, 빼는 지시는 읽혀야 작동합니다.

자주 묻는 질문

robots.txt에 noindex를 쓰면 되나요?

구글은 robots.txt의 noindex 지시를 지원하지 않습니다. 페이지 메타 태그나 X-Robots-Tag 헤더를 사용하십시오.

태그·카테고리 페이지는 noindex 해야 하나요?

일률적인 답은 없습니다. 그 목록이 사용자에게 쓸모 있는 묶음이면 색인해도 됩니다. 자동 생성되어 내용이 겹치기만 한다면 빼는 쪽이 낫습니다. 판단 기준은 검색에 안 잡히는 이유 편의 중복 항목을 참고하십시오.

사이트맵에 noindex 페이지를 넣어도 되나요?

넣지 않는 것이 맞습니다. "색인해 달라"는 신호와 "빼 달라"는 신호가 충돌해 서치콘솔에 경고로 잡힙니다.

이 글의 내용을 사이트에 적용하기 어려우시면, 현재 상태부터 무료로 확인해 드립니다.

무료 진단 신청

관련 콘텐츠