robots.txt에 의해 차단됨
Google Search Console에서 페이지 URL이 robots.txt 규칙에 의해 크롤링이 막혔다고 보고되는 상태입니다.
웹사이트 호스트의 최상위 경로(/robots.txt)에 두는 UTF-8 텍스트 파일로, User-agent·Disallow·Allow·Sitemap 규칙을 입력받아 검색 로봇이 접근할 수 있는 URL 경로를 알려 크롤링을 관리합니다. 적용 범위는 파일이 위치한 호스트·프로토콜·포트로 한정되며, 색인 여부나 접근 권한 자체를 강제하지는 않습니다.
robots.txt는 사이트 최상위 경로에 두는 UTF-8 텍스트 파일로, 검색 로봇에 어떤 URL을 크롤링해도 되는지 알려 크롤러 트래픽을 관리합니다. 색인을 막는 수단이 아니며, 차단된 페이지도 외부 링크가 있으면 검색 결과에 나타날 수 있습니다.
robots.txt는 검색 로봇에게 사이트에서 접근할 수 있는 URL 경로를 알려 주는 텍스트 파일입니다. Google 문서에 따르면 robots.txt는 "주로 사이트로 향하는 크롤러 트래픽을 관리하는 용도"이며, 어떤 URL을 크롤링해도 되는지 크롤러에 전달합니다.
robots.txt는 크롤링(수집)을 관리하는 파일이지, 색인이나 접근을 강제하는 수단이 아닙니다.
적용 범위와 인식 조건은 파일의 위치·형식에 따라 결정됩니다.
| 관찰 대상 | 규칙 |
|---|---|
| 위치 | 호스트의 최상위 경로(https://example.com/robots.txt) |
| 적용 범위 | 파일이 놓인 호스트·프로토콜·포트에만 적용(서브도메인·다른 프로토콜은 별도) |
| 인코딩 | UTF-8 평문 텍스트 |
| 크기 제한 | Google 기준 500KiB, 초과분은 무시 |
| 캐시 | Google은 통상 최대 24시간 캐시 |
++robots.txt를 /blog/robots.txt처럼 하위 경로에 두면 인식되지 않습니다. 반드시 호스트 루트에 둡니다.++
한 줄은 <필드>:<값> 형식이며 Google이 지원하는 필드는 다음과 같습니다.
User-agent: 규칙을 적용할 크롤러를 지정합니다.Disallow: 크롤링을 허용하지 않을 URL 경로입니다.Allow: 크롤링을 허용할 URL 경로입니다.Sitemap: 사이트맵 파일의 전체 URL입니다.경로 값은 사이트 루트를 기준으로 하며 /로 시작하고 대소문자를 구분합니다. *(0개 이상 문자)와 $(URL 끝) 와일드카드를 제한적으로 지원하며, 규칙이 충돌하면 Google은 "가장 덜 제한적인 규칙"을 적용합니다.
robots.txt로 경로를 차단해도 색인 자체가 막히는 것은 아닙니다. Google은 robots.txt가 "웹 페이지를 Google에서 제외하는 수단이 아니다"라고 명시합니다. robots.txt로 차단된 페이지라도 다른 사이트에서 링크되면 색인되어 검색 결과에 나타날 수 있으며, 이때 설명 스니펫은 표시되지 않습니다.
noindex나 비밀번호 보호를 안내합니다.noindex도 읽지 못할 수 있습니다.