검색 노출 · 구성요소 · 검증됨

robots.txt

웹사이트 호스트의 최상위 경로(/robots.txt)에 두는 UTF-8 텍스트 파일로, User-agent·Disallow·Allow·Sitemap 규칙을 입력받아 검색 로봇이 접근할 수 있는 URL 경로를 알려 크롤링을 관리합니다. 적용 범위는 파일이 위치한 호스트·프로토콜·포트로 한정되며, 색인 여부나 접근 권한 자체를 강제하지는 않습니다.

핵심 답변

robots.txt는 사이트 최상위 경로에 두는 UTF-8 텍스트 파일로, 검색 로봇에 어떤 URL을 크롤링해도 되는지 알려 크롤러 트래픽을 관리합니다. 색인을 막는 수단이 아니며, 차단된 페이지도 외부 링크가 있으면 검색 결과에 나타날 수 있습니다.

상세 설명

robots.txt는 검색 로봇에게 사이트에서 접근할 수 있는 URL 경로를 알려 주는 텍스트 파일입니다. Google 문서에 따르면 robots.txt는 "주로 사이트로 향하는 크롤러 트래픽을 관리하는 용도"이며, 어떤 URL을 크롤링해도 되는지 크롤러에 전달합니다.

robots.txt는 크롤링(수집)을 관리하는 파일이지, 색인이나 접근을 강제하는 수단이 아닙니다.

위치와 파일 형식

적용 범위와 인식 조건은 파일의 위치·형식에 따라 결정됩니다.

관찰 대상규칙
위치호스트의 최상위 경로(https://example.com/robots.txt)
적용 범위파일이 놓인 호스트·프로토콜·포트에만 적용(서브도메인·다른 프로토콜은 별도)
인코딩UTF-8 평문 텍스트
크기 제한Google 기준 500KiB, 초과분은 무시
캐시Google은 통상 최대 24시간 캐시

++robots.txt를 /blog/robots.txt처럼 하위 경로에 두면 인식되지 않습니다. 반드시 호스트 루트에 둡니다.++

주요 규칙

한 줄은 <필드>:<값> 형식이며 Google이 지원하는 필드는 다음과 같습니다.

  • User-agent: 규칙을 적용할 크롤러를 지정합니다.
  • Disallow: 크롤링을 허용하지 않을 URL 경로입니다.
  • Allow: 크롤링을 허용할 URL 경로입니다.
  • Sitemap: 사이트맵 파일의 전체 URL입니다.

경로 값은 사이트 루트를 기준으로 하며 /로 시작하고 대소문자를 구분합니다. *(0개 이상 문자)와 $(URL 끝) 와일드카드를 제한적으로 지원하며, 규칙이 충돌하면 Google은 "가장 덜 제한적인 규칙"을 적용합니다.

색인과 혼동하지 않기

robots.txt로 경로를 차단해도 색인 자체가 막히는 것은 아닙니다. Google은 robots.txt가 "웹 페이지를 Google에서 제외하는 수단이 아니다"라고 명시합니다. robots.txt로 차단된 페이지라도 다른 사이트에서 링크되면 색인되어 검색 결과에 나타날 수 있으며, 이때 설명 스니펫은 표시되지 않습니다.

  • 검색 결과에 URL은 뜨지만 설명이 비어 있다면 해당 경로가 robots.txt로 차단된 상태일 수 있습니다.
  • 페이지를 검색 결과에서 제외하려면 robots.txt 차단만으로는 부족합니다. Google 문서는 색인 차단 수단으로 noindex나 비밀번호 보호를 안내합니다.

주의

  • robots.txt는 보안 수단이 아닙니다. 민감한 파일은 접근 제어(비밀번호 보호 등)로 보호합니다.
  • 모든 크롤러가 robots.txt 규칙을 따르지는 않으며, 크롤러마다 구문 해석이 다를 수 있습니다.
  • 색인을 막으려는 목적으로 robots.txt Disallow를 사용하지 않습니다. Disallow가 걸리면 크롤러가 페이지 안의 noindex도 읽지 못할 수 있습니다.