۱sitemap.xml و robots.txt دقیقاً چه فرقی دارند؟
robots.txt فایلی است که به خزندههای گوگل میگوید کدام بخشهای سایت را نباید بخزند؛ سیمانتیک اصلیاش اجازه یا منع است. sitemap.xml برعکس، فهرستی از آدرسهایی است که صاحب سایت میگوید ارزش دیدن دارند؛ سیمانتیک اصلیاش معرفی و کشف است.
سردرگمی رایج این است که این دو را دو نسخه از یک کار بدانیم، در حالی که یکی دربارهٔ محدودکردن دسترسی است و دیگری دربارهٔ کمک به کشف؛ حتی میتوانند همزمان دربارهٔ یک آدرس تناقض داشته باشند، مثلاً آدرسی هم در sitemap باشد هم در robots.txt مسدود شده باشد.
۲robots.txt دقیقاً چه کاری انجام میدهد؟
robots.txt شامل چند گروه User-agent است که هرکدام مشخص میکنند کدام خزنده به کدام مسیرها اجازهٔ عبور دارد یا ندارد؛ دستور Disallow مسیر را میبندد، Allow استثنا میسازد. بدون هیچ خط Disallow، تمام سایت بهطور پیشفرض باز است.
رایجترین خطای فاجعهبار، یک خط Disallow: / زیر User-agent: * است که کل سایت را از خزش گوگل میبندد؛ این خطا معمولاً از دورهٔ توسعه یا مهاجرت سرور باقی میماند و صاحب سایت متوجهش نمیشود.
۳sitemap.xml دقیقاً چه کاری انجام میدهد؟
sitemap.xml فهرستی ساختیافته از آدرسهای سایت است که به گوگل کمک میکند صفحات را سریعتر و کاملتر کشف کند؛ طبق مستندات رسمی گوگل، این فایل «کمک میکند گوگل آدرسهای سایت شما را کشف کند، اما تضمین نمیکند همهٔ آنها خزیده و ایندکس شوند».
گوگل صراحتاً میگوید سایتهای بزرگ، سایتهای تازهراهاندازیشده با لینک ورودی کم، یا سایتهایی با محتوای رسانهای زیاد (تصویر، ویدیو) بیشترین نیاز را به sitemap دارند؛ سایتهای کوچک با لینکسازی داخلی قوی، معمولاً حتی بدونش هم بهخوبی کشف میشوند.
۴این دو فایل چطور به هم وصل میشوند؟
بهترین رویه این است که آدرس sitemap.xml را با یک خط Sitemap: در انتهای robots.txt معرفی کنید؛ این تنها نقطهٔ اتصال رسمی بین این دو فایل است و به خزنده کمک میکند بدون حدسزدن، مستقیم فهرست کامل صفحات را پیدا کند.
نکتهٔ مهم این است که اگر آدرسی در sitemap باشد ولی همان مسیر در robots.txt مسدود شده باشد، خودِ گوگل هرگز اجازهٔ خزیدن آن را نمیدهد، حتی اگر در فهرست باشد؛ یعنی sitemap نمیتواند محدودیت robots.txt را دور بزند.
۵رایجترین اشتباهات سایتهای فارسی در این دو فایل
چهار اشتباه بیشترین تکرار را دارند: باقیماندن Disallow کلی از دورهٔ توسعه، sitemap ناقص یا قدیمی که هنگام افزودن صفحهٔ تازه بهروز نمیشود، نبود خط Sitemap: در robots.txt، و تناقض بین آدرسهای sitemap با نسخهٔ نهایی HTTPS یا www سایت.
خیلی از سیستمهای مدیریت محتوای فارسی، sitemap را بهصورت خودکار میسازند، اما اگر ساختار URL سایت دستی تغییر کرده باشد، این فایل خودکار میتواند آدرسهای قدیمی و مرده را همچنان نگه دارد.
۶این دو فایل چقدر مستقیم روی رتبه اثر دارند؟
نه robots.txt و نه sitemap.xml هیچکدام مستقیم رتبه نمیدهند؛ اما هر دو در لایهٔ فنی و پیش از رتبهبندی قرار دارند، دقیقاً همانجایی که یک اشتباه ساده میتواند مانع دیدهشدن کل سایت شود، فارغ از کیفیت محتوا.
اگر robots.txt بهاشتباه یک بخش مهم را ببندد، آن بخش هیچوقت وارد رقابت رتبهبندی نمیشود؛ اگر sitemap ناقص باشد، کشف صفحات تازه کندتر میشود. این دو، پایهٔ همان سئوی تکنیکالی هستند که بدون آن هیچ محتوایی دیده نمیشود.
۷چطور در چند دقیقه sitemap و robots.txt سایتتان را چک کنید
کافی است آدرس سایتتان را با پسوند /robots.txt در مرورگر باز کنید و ببینید آیا خط Disallow کلی وجود دارد یا نه، و آیا خط Sitemap: به فایل sitemap.xml اشاره میکند. بعد همان آدرس sitemap را باز کنید و چند صفحهٔ مهم سایت را در فهرستش جستوجو کنید.
بهترین راه فهمیدن اینکه این دو فایل درست تنظیم شدهاند یا نه، بدون خواندن دستی خطبهخط، یک اسکن خودکار است که هر دو را همزمان بررسی میکند و تناقضهای احتمالی را نشان میدهد.
بهترین راه فهمیدن اینکه این دو فایل درست تنظیم شدهاند، یک آنالیز وب سایت است که robots.txt و sitemap سایتتان را همزمان چک میکند و تناقضهای احتمالی را نشان میدهد.
robots.txt دربارهٔ اجازهٔ عبور است، sitemap.xml دربارهٔ نقشهٔ راه؛ این دو نه رقیب هماند نه جایگزین هم. سردرگمی رایج وقتی شکل میگیرد که یکی از این دو نادیده گرفته شود یا اشتباه تنظیم شود، دقیقاً همان چیزی که این راهنما کمک میکند از آن دور بمانید.