サイトマップとrobots.txtを見直したときの作業
設定したまま確認していませんでした。実際に見て直した記録です。

この記事の結論
- 設定したまま、中身を見ていなかった
- 不要なページが含まれていた
- 確認は数分で済む
- 設定したまま、中身を見ていなかった
- 不要なページが含まれていた
- 確認は数分で済む
サイトマップとrobots.txtは、設定したまま確認していなかった。実際に開いて、直した記録を書く。
何のためのものか
まず役割を確認した。
- サイトマップ — どのページがあるか知らせる
- robots.txt — どこを見てよいか指示する
- どちらも、機械が読むもの
3つ目なので、人が見ることは少なく、放置されやすい。
サイトマップを見る
実際に開いて、中身を確認した。
- 記事がすべて含まれているか
- 不要なページが入っていないか
- 公開していないページが漏れていないか
2つ目で問題が見つかった。テスト用のページが含まれていた。
含めないもの
除外する対象を整理した。
- テスト用のページ
- 重複する内容のページ
- 検索結果のページ
- 公開する意図が無いページ
3つ目は自動で生成されることがある。意図せず含まれている場合がある。
robots.txtを見る
こちらも開いて確認した。
- 管理画面が除外されているか
- サイトマップの場所が書かれているか
- 意図せず全体を拒否していないか
3つ目は致命的だ。一行間違えると、全ページが見られなくなる。
書き方の注意
robots.txtは、書き方で意味が大きく変わる。
- 対象の指定と、許可・拒否の対応
- 順番によって、効き方が変わる場合がある
- 間違えると、意図と逆になる
3つ目を避けるため、書いた後に確認する道具を使っている。
インデックスの状況を見る
設定した後、実際にどう扱われているかも確認している。
- 登録されているページ数
- 除外されたページと、その理由
- 意図した状態と合っているか
2つ目で問題が見つかることがある。意図せず除外されているページがあった。設定が正しくても、結果が意図どおりとは限らない。設定と結果の両方を見る必要があった。
AIのクローラーへの対応
最近は、こちらも考える必要がある。
- 学習に使うクローラーを、許可するか拒否するか
- 方針として決める
- 決めたら、明示的に書く
自分のサイトでは、許可する方針にした。誤った要約で引用されるより、正しい情報を渡すほうがよいと判断した。
llms.txtという形式
AIに向けた案内を置く形式も試している。
- サイトの概要と、主要な記事を示す
- 全ページを辿らずに、全体を把握できる
- 効果は測れていない
3つ目は正直に書いておく。置いても損は無いが、効果は確認できていない。
確認の頻度
一度直したら、定期的に見ている。
- 3か月に1度、開いて見る
- ページを追加したときも確認する
- 5分で終わる
2つ目が必要だ。新しい種類のページを作ると、含まれ方が変わる。
除外の指定を間違えた例
実際にやった失敗を書いておく。
- テスト用のディレクトリを除外しようとした
- 指定が広すぎて、本番の一部も含まれた
- 気づくまで、数日かかった
3つ目が問題だった。拒否しても、すぐには影響が出ない。設定を変えた直後に、確認する道具で意図どおりか確かめるという手順を入れた。確認は数分で済む。
サイトマップの自動生成
手で管理せず、自動で作られる形にしている。
- 記事を追加すると、自動で含まれる
- 除外したいものは、設定で指定する
- 手で書くと、必ず漏れる
3つ目は確実に起きる。150本を手で管理するのは無理だ。自動で作られる前提にして、除外する条件だけ管理する形が現実的だった。
確認する道具
自分で読むだけでなく、道具も使っている。
- 検索エンジンが提供する確認の機能
- どう解釈されるか表示される
- 意図と合っているか確かめられる
2つ目が重要だ。自分の解釈と、機械の解釈が違うことがある。
まとめ
- 機械が読むものなので、放置されやすい
- テスト用のページが含まれていることがある
- robots.txtは、一行で全体を拒否してしまうことがある
- 確認する道具で、解釈を確かめる
- 3か月に1度、開いて見るだけで足りる
関連記事
RELATED
半年で身についた作業の順番
コードを書く作業の進め方が、固まってきました。
控えの取り方を決めた話
取っているつもりで取れていなかったので、見直しました。
表示が遅い原因を、順番に調べた作業
感覚で直す前に、測って原因を特定しました。