저희는 만든 걸 전부 공개하는 곳인데, 정작 그 얘기를 적을 블로그가 없었어요. 그래서 하나 만들기로 하고 플랫폼부터 골랐습니다. 고르는 김에 평소 그냥 믿고 있던 것들을 직접 재보고 출처를 찾아봤어요.
먼저 결론만 적으면 이렇습니다.
- 이미지는
src/에 두면 Astro가 webp로 바꿔 줍니다. 2,394KB PNG 한 장이 16~95KB 파일 다섯 개로 나갔어요. llms.txt는 구글 검색 순위와 상관이 없어요. 그래도 AI 도구가 요청한 기록이 있고 만드는 비용이 없어서 넣었습니다.- 네이버 첫 페이지 웹문서 14건 중 13건이 외부 사이트였어요.
- 새 페이지가 1년 안에 구글 10위 안에 드는 비율은 2~6%라서, 초반에는 검색 유입을 기대하지 않아요.
이미지는 줄여서 올리는 게 아니었다
블로그에 스크린샷을 많이 올릴 예정이라 용량이 걱정됐어요. GitHub Pages는 발행 사이트가 1GB를 넘으면 안 되고, 월 대역폭은 100GB가 soft limit이에요(GitHub 문서). 그래서 처음에는 “커밋하기 전에 이미지를 줄이는 습관을 들여야겠다”고 생각했어요.
틀렸습니다. 중요한 건 압축이 아니라 어느 폴더에 두느냐였어요.
Figma에서 내보낸 2,000 x 2,000 PNG 한 장(2,394KB)을 손대지 않고 src/에 넣은 다음,
이 블로그 설정 그대로 빌드해 봤어요.
| 빌드가 만든 파일 | 크기 |
|---|---|
| 640px webp | 15.6KB |
| 960px webp | 30.5KB |
| 1280px webp | 46.1KB |
| 1920px webp | 86.7KB |
| 2000px webp | 95.1KB |
| 다섯 개 합계 | 274KB |
원본 PNG는 저장소에만 남고 발행 사이트에는 들어가지 않아요. 방문자의 브라우저는 화면 폭과 픽셀 밀도에 맞는 파일 하나만 받아 갑니다. 레티나 노트북이라면 1920px이나 2000px 파일(87~95KB)을 받고, 폭이 좁은 저해상도 화면이라면 640px 파일(16KB)을 받아요. 저희가 손으로 한 건 없습니다.
단, 이건 이미지를 src/ 안에 뒀을 때 얘기예요. public/에 두면 Astro가 손대지 않고 그대로
내보냅니다. Astro 공식 문서에도 “no processing”이라고
적혀 있어요. 같은 PNG가 2,394KB 그대로 나간다는 뜻이고, 발행 용량으로 따지면 274KB와 약 9배 차이예요.
1GB 안에 담을 수 있는 이미지 수도 그만큼 달라집니다.
한 가지 더. 화면 크기별 파일은 저절로 생기지 않아요. Astro의 image.layout 기본값은 비어 있어서,
설정하지 않으면 src/에 둔 Markdown 이미지는 원본 크기 webp 한 장만 나갑니다. 전역 image.layout을 켜면
이번에는 기본 breakpoint 목록 중 원본 폭 이하인 단계마다 파일이 생겨서, 이 PNG는 일곱 개가 돼요.
저희는 본문 폭에 맞춰 단계를 640, 960, 1280, 1920 네 개로 줄였고, 그래서 위 표처럼 다섯 개가 나왔어요.
llms.txt는 검색 순위용이 아니었다
AI 검색에 인용되려면 llms.txt를 둬야 한다는 얘기를 자주 봤어요. 이 글을 처음 올렸을 때는
“넣을 이유가 없다”고 적었는데, 근거를 다시 확인해 보니 절반만 맞았어요.
맞았던 절반은 구글 검색 쪽이에요. 구글 Search Central의
생성형 AI 최적화 가이드는
AI 개요와 AI 모드를 포함한 구글 검색에 나오는 데 llms.txt 같은 AI용 파일이 필요 없고,
구글 검색은 이 파일을 쓰지 않는다고 적고 있어요. 2026년 6월 15일
개정에서는 다른 서비스를 위해 llms.txt를 두는 건
괜찮고, 구글 검색 순위에는 득도 실도 없다는 문장이 더해졌습니다.
틀렸던 절반은 “아무도 안 읽는다”는 부분이에요.
- 구글의 존 뮬러가 2025년 6월에 “현재 llms.txt를 쓰는 AI 시스템은 없다”고 한
블루스카이 답글이 자주 인용돼요.
1년도 더 된 개인 답글이에요. 2026년 5월에 그가 다시 남긴
답글은 결이 조금 달라요.
llms.txt는 “검색을 위한 게 아니다”라고 하면서, AI 코딩 도구가 개발자 문서를 읽을 때 토큰을 아끼는 임시 방편에 가깝고 개발자 문서가 아닌 사이트에는 별 의미가 없어 보인다고 했어요. - Ahrefs가 2026년 6월에 낸 조사를 보면,
llms.txt를 둔 도메인 약 3만 8천 개 중 97%는 5월 한 달 동안 요청을 한 번도 받지 않았어요. 요청이 들어온 약 1,100곳에서는 요청의 19.5%가 이름이 확인된 AI 봇이었고, 가장 많은 건 GPTBot이었어요. Claude Code도 상위에 있었고요. 반면 OAI-SearchBot, PerplexityBot 같은 AI 검색 수집 봇은 전체 요청의 1.1%에 그쳤어요. - 같은 구글이어도 Chrome의 Lighthouse는 2026년 5월 릴리스부터 실험 단계인 에이전트 브라우징 항목에서
llms.txt를 검사해요(Chrome 문서). 문서는 이 파일을 “새로 떠오르는 관례(emerging convention)“이고 아직은 선택 사항이라고 설명합니다. - 규격은 제러미 하워드가 2024년 9월에 제안했고 2026년 8월에 v2가 나왔어요. 다만 표준화 기구 문서가 아니라 지금도 개인이 낸 제안이에요.
정리하면 llms.txt는 검색 순위를 올리는 파일이 아니에요. AI 도구가 사이트 구조를 빨리 파악하도록 돕는
안내문에 가깝고, 그마저도 요청하는 곳이 아직 적어요. 저희는 개발 얘기를 주로 쓰는 블로그라 코딩 도구가 읽을
여지가 있고, 빌드할 때 글 목록에서 자동으로 만들어져 관리할 게 없어서 넣었습니다. 효과는 기대하지 않아요. nomadamas.github.io/llms.txt에서 볼 수 있어요.
AI 검색 인용에 실제로 근거가 있는 건 평범한 것들이었어요.
- 검색용 크롤러를
robots.txt에서 막지 않기. ChatGPT 검색 결과에 나오려면 OAI-SearchBot을 막지 말라고 OpenAI 문서에 적혀 있어요. - 구글 검색에 색인되기. 구글 가이드가 AI 기능에 나오는 조건으로 드는 건 페이지가 색인되고 스니펫과 함께 검색 결과에 나올 수 있는 상태인지예요. 별도 파일이 아니라 일반 검색과 같은 조건이에요.
- 본문에 출처와 수치 넣기. 2024년 KDD에 실린 GEO 논문은 인용문, 통계 수치, 출처 표기를 넣으면 생성형 검색 답변에서 그 출처가 차지하는 비중이 30~40% 늘었다고 보고했어요. 인용될 확률을 잰 게 아니라, 이미 검색된 출처끼리 답변 속 비중을 비교한 실험이라는 점은 감안해야 해요.
여기서 한 가지 조심할 게 있어요. 호스팅이 크롤러를 열어 둬도 앞단 CDN 설정이 그걸 덮을 수 있습니다. Cloudflare 프록시(주황 구름)를 켜면 Cloudflare의 AI 봇 설정이 GitHub Pages보다 먼저 적용돼요. 2026년 9월 15일부터는 학습용 봇 차단을 켜 둔 도메인에서 Googlebot, Bingbot 같은 검색 겸용 크롤러까지 막힙니다(Cloudflare 블로그). 그래서 나중에 도메인을 붙일 때는 프록시를 끈 DNS only(회색 구름)로 연결할 예정이에요.
네이버는 외부 사이트를 안 잡는다고 알고 있었는데
한국 독자를 생각하면 네이버가 걸립니다. 네이버는 자기네 블로그만 위에 올려주니까 외부 사이트는 소용없다는 얘기를 많이 듣잖아요. 그래서 실제로 검색해 봤어요.
2026년 9월 23일, 로그인하지 않은 상태로 네이버 PC 통합검색에서 “타입스크립트 제네릭”을 검색했어요.
맨 위 AI 브리핑과 네이버 메이트 영역 아래 첫 결과는 외부 사이트인 요즘IT였고, 다음이 네이버 시리즈 e북,
그다음이 네이버 블로그 글 세 개였어요. 첫 페이지 웹문서 14건 중 13건이 외부 사이트였고,
그중 GitHub Pages로 올린 곳도 두 곳(캡틴판교의 타입스크립트 핸드북 joshua1988.github.io, NHN Cloud의
TOAST UI 블로그 ui.toast.com) 있었어요. AI 브리핑이 인용한 출처 7건 중 3건도 외부 사이트였고요.
물론 키워드 하나로 일반화할 수는 없고, 검색 결과는 시점과 로그인 상태에 따라 달라져요. 새 사이트가 처음 수집되기까지 얼마나 걸리는지는 네이버 서치어드바이저 가이드에 나와 있지 않아요. 수집 요청한 URL이 수집되기까지 우선순위에 따라 “최소 1일에서 몇 주”, 검색로봇이 방문한 뒤 검색에 반영되기까지 “최대 1주일 이내”가 걸린다고만 적혀 있어요.
다만 “외부 사이트는 아예 안 잡힌다”는 건 사실이 아니었어요. 네이버 FAQ도 웹마스터도구에 등록하지 않은 사이트까지 검색 로봇이 자동으로 수집한다고 적고 있어요. 그래도 등록은 해두려고 해요. 등록하고 소유확인을 하면 sitemap과 RSS를 직접 제출하고, 수집과 노출 리포트를 볼 수 있거든요.
그래서 얼마나 기대하고 있나
구글 쪽 기대치는 낮게 잡았어요. Ahrefs가 2025년 5월에 낸 조사에서 2023년 9월에 새로 발견된 무작위 URL 100만 개 중 1년 안에 구글 상위 10위에 든 비율은 1.74%였어요. 비어 있지 않은 영어 페이지만 따로 보면 6.11%였고요. 글 스무 편에 그대로 곱하면, 1년 안에 10위 안에 드는 글은 0.35편에서 1.2편 정도예요.
그래서 초반 지표는 검색 클릭수 대신 색인된 페이지 수와 노출수로 보기로 했습니다. 읽히는 건 당분간 저희가 직접 옮겨 나르는 쪽이 맞아요.
2026년 9월 23일 수정. 처음 올린 글에 틀린 내용이 있어 바로잡았어요. 이미지는 스크린샷이 아니라
Figma에서 내보낸 PNG였고, 방문자가 받는 파일은 48KB 한 장이 아니라 화면에 따라 1695KB예요.
네이버 검색 결과 순서, Ahrefs 수치로 계산한 기대값(0편이 아니라 0.351.2편), llms.txt 절도 고쳤습니다.
이 블로그는 Astro로 만들어 GitHub Pages에 올립니다. 저장소는 NomaDamas/nomadamas.github.io에 공개돼 있어요. 설정을 그대로 가져다 쓰셔도 됩니다.