robots.txt에서 AI를 막고 있진 않습니까 (2026) — 들어와서 읽기까지 7항목

· 최준호 (Jack Choi)

콘텐츠를 아무리 발행해도 크롤러가 읽지 못하면 인용은 없습니다. AI 답변에 회사가 안 보인다면 글을 더 쓰기 전에 robots.txt부터 열어 보십시오. 도메인 뒤에 /robots.txt를 붙이면 바로 보입니다.

1분 요약

  • AI 크롤러를 한 덩어리로 묶어 막으면 손해입니다. 학습용과 답변용은 하는 일이 다릅니다.
  • robots.txt가 열려 있어도 CDN이나 WAF에서 막히는 경우가 잦습니다. 세 곳을 다 봐야 합니다.
  • 들어오는 것과 읽는 것은 다른 문제입니다. 접근 4항목을 통과해도 판독 3항목에서 걸리면 글은 전달되지 않습니다.
  • 저희가 진단한 한 고객사는 접근 항목이 전부 정상이었는데도 발견형 질문에서 4%였습니다. 걸린 곳은 판독과 구분 쪽이었습니다.
  • 접근성은 필요조건이지 충분조건이 아닙니다. 저희 사이트도 3종이 다 정상인 상태에서 브랜드 질문 0/15였습니다.

봇마다 하는 일이 다릅니다

AI 크롤러를 한 덩어리로 묶어 막으면 손해입니다.

  • GPTBot — OpenAI가 학습 데이터를 모을 때 씁니다.
  • OAI-SearchBot — ChatGPT가 검색해 답할 때 페이지를 가져갑니다.
  • Google-Extended — 구글의 AI 활용 범위를 조절합니다.
  • ClaudeBot, PerplexityBot — 각각 따로 있습니다.

학습에는 내주고 싶지 않지만 답변에는 등장하고 싶다면 학습용만 막고 답변용은 열어 두면 됩니다. 봇 이름과 동작은 각 회사 공식 문서에서 다시 확인하십시오. 이름이 바뀌거나 새로 생깁니다.


진짜 막는 쪽은 CDN일 때가 많습니다

robots.txt가 열려 있어도 CDN과 WAF에서 막히는 경우가 잦습니다. Cloudflare 같은 서비스의 봇 차단이 켜져 있으면 요청 자체가 거부됩니다. robots.txt만 보고 "열려 있다"고 판단하면 몇 달을 헛돌게 됩니다.

확인은 세 단계입니다.

  1. robots.txt의 Disallow에 봇 이름이 있는지 봅니다.
  2. CDN과 WAF의 봇 관리 설정을 확인합니다.
  3. 서버 로그를 User-Agent로 걸러 실제 방문을 셉니다. 이게 유일한 확정 근거입니다. 앞의 둘은 설정이고 이것은 사실입니다.

묶음 1 — AI가 들어올 수 있습니까 (4항목)

# 항목 안 고치면 생기는 일 손보는 값
1 AI 크롤러 접근 차단 여부 AI가 아예 못 들어옴 하루 이틀
2 글이 전부 사이트맵에 등록 새 글이 발견되지 않음 하루 이틀
3 주소가 https 하나로 정리 같은 글이 둘로 세어짐 하루 이틀
4 옛 주소가 새 페이지로 연결 쌓아온 신뢰가 끊김 하루 이틀

네 항목 모두 하루 이틀이면 끝납니다. 여기서 막혀 있으면 콘텐츠 이야기를 할 단계가 아닙니다.


묶음 2 — 들어와서 우리 글자를 읽습니까 (3항목)

접근이 열려 있어도 읽히지 않는 경우가 여기서 갈립니다.

# 항목 안 고치면 생기는 일 손보는 값
5 AI가 처음 받는 화면에 본문이 있는가 글을 써도 전달되지 않음 (최우선) 개월 단위
6 설명이 이미지 속 글자로만 들어 있지 않은가 그 설명이 없는 것과 같음 며칠
7 클릭해야 비로소 불러오는 내용이 있는가 핵심 내용이 통째로 누락 며칠

5번이 가장 자주 걸리고 가장 오래 걸립니다. 사람이 브라우저로 보면 본문이 가득한데 크롤러가 받아 가는 시점에는 껍데기만 오는 구조가 흔합니다. 화면에 보이는 것과 AI가 가져가는 것이 다르면 발행 편수는 의미를 잃습니다.


전부 정상인데도 안 나오는 경우

저희가 진단한 한 고객사가 그랬습니다.

항목 실측 결과
크롤러 접근 전체 개방 — 정상
사이트맵 정상, 30여 페이지 등록
https 전환 정상
홈 구조화 데이터 보유
콘텐츠 30여 편 발행 (영어 포함)
페이지 제목 전 페이지가 홈페이지 제목과 동일하게 반복
글 페이지 구조화 데이터 글 페이지에도 회사 표시만 반복
크롤러 시점 본문 홈 약 700자 / 글 페이지 약 300자

접근 4항목은 전부 통과했습니다. 그런데 이름을 뺀 발견형 질문에서 117회 중 5회였습니다.

걸린 곳은 접근이 아니라 그다음이었습니다. 크롤러가 들어와서 받아 간 게 300자였고, 서른 편의 제목이 전부 같아 서로 다른 문서로 구분되지도 않았습니다. AI 입장에서는 서른 편이 아니라 같은 문서가 서른 번 있는 셈입니다.

파는 쪽도 마찬가지입니다. 저희 사이트는 robots.txt에서 AI 크롤러를 열어 뒀고 sitemap.xml과 llms.txt가 모두 정상 응답합니다. 그 상태에서 브랜드 단독 질문 15종의 결과가 0건이었습니다. 접근성은 필요조건이지 충분조건이 아닙니다.


30초 확인법

업체에 물어보기 전에 직접 보실 수 있는 것들입니다.

  • 제목 중복 — 글 다섯 편을 각각 새 탭으로 열고 탭에 뜨는 제목을 비교합니다. 같으면 8번이 걸린 겁니다.
  • 본문 존재 — 글 페이지에서 소스 보기를 열고 본문 첫 문장을 찾아봅니다. 없으면 5번입니다.
  • 이미지 속 글자 — 설명 문단을 마우스로 드래그해 봅니다. 선택이 안 되면 6번입니다.

순서

  1. 접근 4항목 — 하루 이틀. 여기가 막혀 있으면 나머지는 의미가 없습니다.
  2. 판독 3항목 — 5번이 걸려 있으면 개월 단위로 잡으십시오.
  3. 그다음이 콘텐츠입니다.

저희는 AI 노출 진단에서 콘텐츠보다 이 경로를 먼저 봅니다. 크롤러가 실제로 들어오는지 서버 로그로 확인하고 크롤러가 받아 가는 시점의 본문을 따로 받아 봅니다.


함께 보시면 좋은 글


측정 조건 고지 — 고객사 홈페이지 진단은 2026년 8월 13일 렌더링 후 DOM 기준 실측입니다. 발견형 5/117은 같은 날 ChatGPT(임시 채팅), Claude(웹검색), Gemini(검색연동) 3개 엔진에서 질문 13종을 반복 질의해 얻은 결과입니다. 고객사 요청에 따라 실명은 밝히지 않습니다. 해당 고객사는 병원 업종이며 업종이 다르면 수치도 달라집니다. 자사 사이트 접근성 3종 정상과 브랜드 질문 0/15는 2026년 8월 22일 tppoint.kr 실측입니다. 봇 이름과 동작은 각 AI 사업자의 공식 문서 기준이며 변경될 수 있습니다.

지금 AI가 귀사를 어떻게 말하는지 확인해 보세요

브랜드를 지정해 주시면 같은 형식의 진단 리포트를 3영업일 안에 드립니다.

무료 진단 신청 →

제출하신 정보는 진단 리포트 작성·발송과 상담 목적으로만 사용하며 1년 보관 후 파기합니다. 개인정보 처리방침