راهنمای کامل دستورالعمل برای رباتهای گوگل
فایل دستورالعمل برای رباتهای گوگل Robots.txt، اگر سایت دارید و به سئو اهمیت میدهید، حتماً باید با فایل Robots.txt آشنا باشید. این فایل یکی از مهمترین بخشهای سئو تکنیکال است و به رباتهای موتورهای جستجو مثل گوگل اعلام میکند که اجازه دارند کدام قسمتهای سایت را بررسی کنند و از ورود به کدام بخشها خودداری کنند. به زبان ساده، Robots.txt فایل دستورالعمل برای رباتهای گوگل است که مسیر خزش یا همان Crawling را مدیریت میکند.
بسیاری از افراد تصور میکنند فایل Robots.txt مستقیماً تعیین میکند که کدام بخش سایت در گوگل ایندکس شود یا نشود؛ اما این تعریف کاملاً دقیق نیست. Robots.txt بیشتر برای کنترل خزش رباتها استفاده میشود، نه کنترل قطعی ایندکس. یعنی شما با این فایل به ربات گوگل میگویید وارد یک مسیر خاص نشود، اما اگر آن صفحه از جای دیگری لینک شده باشد، ممکن است همچنان آدرس آن در نتایج گوگل دیده شود. برای جلوگیری قطعی از ایندکس، معمولاً باید از تگ noindex استفاده کرد.
با این حال، اهمیت robots.txt در سئو بسیار زیاد است. اگر این فایل بهدرستی تنظیم شود، میتواند از هدر رفتن بودجه خزش جلوگیری کند، دسترسی رباتها به صفحات بیارزش را محدود کند و به گوگل کمک کند روی صفحات مهم سایت تمرکز بیشتری داشته باشد. اما اگر اشتباه تنظیم شود، ممکن است باعث شود صفحات مهم سایت شما توسط گوگل بررسی نشوند و در نتیجه رتبه و بازدید سایت آسیب ببیند.
فایل Robots.txt چیست؟
Robots.txt یک فایل متنی ساده است که در ریشه اصلی سایت قرار میگیرد و دستورالعملهایی را برای رباتهای موتور جستجو مشخص میکند. رباتهای گوگل، بینگ و سایر موتورهای جستجو قبل از بررسی سایت، معمولاً ابتدا فایل robots.txt را میخوانند تا بدانند اجازه ورود به چه بخشهایی را دارند.
آدرس این فایل معمولاً به شکل زیر است:
https://example.com/robots.txt
اگر بخواهید فایل robots.txt سایت خود را ببینید، کافی است بعد از نام دامنه، عبارت /robots.txt را وارد کنید. برای مثال:
https://yourdomain.com/robots.txt
این فایل میتواند بسیار ساده یا نسبتاً پیچیده باشد. در سادهترین حالت، robots.txt مشخص میکند که تمام رباتها به همه بخشهای سایت دسترسی داشته باشند یا برخی مسیرها برای آنها مسدود شود.
نمونه ساده فایل robots.txt:
User-agent: *
Disallow:
این دستور یعنی همه رباتها اجازه دارند کل سایت را بررسی کنند.
نمونه دیگر:
User-agent: *
Disallow: /admin/
این دستور یعنی همه رباتها اجازه ندارند وارد مسیر /admin/ شوند.
Robots.txt چه کاربردی دارد؟
کاربرد اصلی فایل Robots.txt مدیریت رفتار رباتهای موتور جستجو در زمان خزش سایت است. وقتی گوگلبات وارد سایت شما میشود، با کمک این فایل میفهمد کدام مسیرها را بررسی کند و کدام مسیرها را نادیده بگیرد.
مهمترین کاربردهای robots.txt عبارتاند از:
- جلوگیری از خزش صفحات مدیریتی سایت
- محدود کردن دسترسی رباتها به صفحات کمارزش
- جلوگیری از بررسی صفحات تکراری یا فیلترهای فروشگاهی
- مدیریت بودجه خزش یا Crawl Budget
- معرفی آدرس نقشه سایت به موتورهای جستجو
- جلوگیری از فشار بیش از حد رباتها روی سرور
- هدایت بهتر رباتها به سمت صفحات مهمتر
برای مثال، در فروشگاههای اینترنتی ممکن است صفحات فیلتر زیادی ایجاد شود؛ مثل رنگ، سایز، قیمت، برند و مرتبسازی محصولات. اگر همه این صفحات توسط گوگل بررسی شوند، ممکن است بودجه خزش سایت روی صفحات کمارزش مصرف شود. در چنین شرایطی، تنظیم درست robots.txt میتواند به بهینهسازی خزش کمک کند.
تفاوت Crawling و Indexing در robots.txt
برای درک بهتر robots.txt باید تفاوت دو مفهوم مهم را بدانید: خزش یا Crawling و ایندکس یا Indexing.
خزش یعنی ربات گوگل وارد یک صفحه میشود و محتوای آن را بررسی میکند. ایندکس یعنی گوگل بعد از بررسی صفحه، تصمیم میگیرد آن را در پایگاه داده خود ذخیره کند تا در نتایج جستجو نمایش دهد.
فایل robots.txt بیشتر روی خزش اثر دارد، نه روی ایندکس. یعنی اگر شما صفحهای را در robots.txt مسدود کنید، گوگل نباید آن صفحه را بخزد. اما اگر همان صفحه از سایتهای دیگر لینک گرفته باشد، گوگل ممکن است آدرس آن را بدون بررسی محتوا در نتایج نمایش دهد.
برای مثال اگر این دستور را بنویسید:
User-agent: *
Disallow: /private-page/
گوگل نمیتواند محتوای صفحه /private-page/ را بررسی کند. اما اگر این صفحه قبلاً ایندکس شده باشد یا از جای دیگری لینک داشته باشد، ممکن است همچنان در نتایج گوگل ظاهر شود، البته معمولاً بدون توضیح کامل.
پس اگر هدف شما این است که صفحهای در نتایج گوگل نمایش داده نشود، robots.txt همیشه بهترین گزینه نیست. برای حذف قطعی از ایندکس باید از روشهایی مثل تگ noindex، حذف صفحه، رمزگذاری، یا ابزار Removals در Google Search Console استفاده کنید.
ساختار فایل Robots.txt
فایل robots.txt از چند دستور اصلی تشکیل میشود. مهمترین دستورها عبارتاند از:
دستور User-agent
دستور User-agent مشخص میکند که قوانین برای کدام ربات اعمال شوند. اگر از علامت ستاره * استفاده کنید، یعنی قانون برای همه رباتهاست.
مثال:
User-agent: *
یعنی همه رباتهای موتورهای جستجو باید این دستورها را رعایت کنند.
اگر بخواهید فقط برای ربات گوگل دستور خاصی بنویسید، میتوانید از این حالت استفاده کنید:
User-agent: Googlebot
دستور Disallow
دستور Disallow مشخص میکند که ربات اجازه ورود به چه مسیری را ندارد.
مثال:
User-agent: *
Disallow: /wp-admin/
یعنی همه رباتها اجازه ندارند مسیر /wp-admin/ را بررسی کنند.
اگر Disallow خالی باشد، یعنی رباتها اجازه بررسی همه بخشها را دارند:
User-agent: *
Disallow:
اما اگر به شکل زیر نوشته شود:
User-agent: *
Disallow: /
یعنی همه رباتها از بررسی کل سایت منع میشوند. این دستور بسیار خطرناک است و اگر اشتباهی در سایت فعال باشد، میتواند باعث افت شدید ایندکس و بازدید سایت شود.
دستور Allow
دستور Allow معمولاً برای اجازه دادن به یک مسیر خاص داخل مسیری استفاده میشود که بهطور کلی مسدود شده است.
مثال:
User-agent: *
Disallow: /folder/
Allow: /folder/important-page.html
در این مثال، کل مسیر /folder/ مسدود است، اما صفحه important-page.html داخل همان مسیر اجازه خزش دارد.
دستور Sitemap
با دستور Sitemap میتوانید آدرس نقشه سایت را به رباتها معرفی کنید. این کار به موتورهای جستجو کمک میکند صفحات مهم سایت را راحتتر پیدا کنند.
مثال:
Sitemap: https://example.com/sitemap.xml
معمولاً توصیه میشود آدرس نقشه سایت در فایل robots.txt قرار بگیرد، حتی اگر آن را در Google Search Console هم ثبت کرده باشید.
نمونه فایل Robots.txt استاندارد
یک نمونه ساده و استاندارد برای بسیاری از سایتهای وردپرسی میتواند شبیه زیر باشد:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
در این نمونه، دسترسی به بخش مدیریت وردپرس محدود شده، اما فایل admin-ajax.php که ممکن است برای عملکرد برخی بخشهای سایت لازم باشد، مجاز است. همچنین نقشه سایت به موتورهای جستجو معرفی شده است.
برای سایتهای فروشگاهی، ممکن است تنظیمات پیچیدهتر باشد. مثلاً برخی صفحات فیلتر، سبد خرید، حساب کاربری و پرداخت بهتر است توسط رباتها بررسی نشوند:
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /*?orderby=
Disallow: /*?filter=
Sitemap: https://example.com/sitemap.xml
البته این موارد باید با دقت و بر اساس ساختار سایت تنظیم شوند. مسدود کردن اشتباه پارامترها یا مسیرها ممکن است باعث شود صفحات مهم سایت از دسترس گوگل خارج شوند.
اهمیت Robots.txt در سئو تکنیکال
فایل robots.txt بخش مهمی از سئو تکنیکال است، زیرا روی نحوه تعامل رباتهای موتور جستجو با سایت اثر میگذارد. اگر سایت شما کوچک باشد و فقط چند صفحه داشته باشد، شاید اهمیت این فایل کمتر احساس شود. اما برای سایتهای بزرگ، فروشگاههای اینترنتی، سایتهای خبری و پورتالها، robots.txt میتواند نقش بسیار مهمی داشته باشد.
یکی از مفاهیم مهم در این زمینه، بودجه خزش یا Crawl Budget است. گوگل برای هر سایت مقدار مشخصی زمان و منابع برای خزش در نظر میگیرد. اگر ربات گوگل وقت خود را صرف بررسی صفحات بیارزش، تکراری یا غیرضروری کند، ممکن است صفحات مهم سایت دیرتر بررسی شوند.
با تنظیم درست robots.txt میتوانید مسیرهای کماهمیت را از دسترس رباتها خارج کنید و کاری کنید که گوگل بیشتر روی صفحات ارزشمند تمرکز کند. این موضوع بهخصوص برای سایتهایی با هزاران یا میلیونها URL اهمیت زیادی دارد.
از طرف دیگر، robots.txt میتواند جلوی خزش بخشهایی را بگیرد که نیازی نیست در گوگل بررسی شوند؛ مثل صفحات ورود، ثبتنام، سبد خرید، پنل کاربری، صفحات جستجوی داخلی و مسیرهای مدیریتی.
چه صفحاتی را بهتر است در Robots.txt مسدود کنیم؟
همه صفحات سایت نباید در دسترس رباتهای گوگل باشند. برخی مسیرها ارزش سئویی ندارند و خزش آنها فقط منابع گوگل و سرور را مصرف میکند.
صفحاتی که معمولاً میتوان در robots.txt مسدود کرد:
- صفحات مدیریت سایت
- صفحات ورود و ثبتنام
- سبد خرید و پرداخت
- پنل کاربری
- صفحات جستجوی داخلی سایت
- برخی پارامترهای فیلتر در فروشگاهها
- صفحات تستی و موقت
- فایلها یا مسیرهای غیرضروری
- نتایج مرتبسازی محصولات در صورت ایجاد URLهای تکراری
اما باید مراقب باشید صفحات مهم را مسدود نکنید. برای مثال نباید دستهبندیهای اصلی، صفحات محصولات، مقالات، صفحات خدمات یا فایلهای ضروری CSS و JavaScript را بدون دلیل ببندید. گوگل برای درک کامل صفحه نیاز دارد فایلهای CSS و JS را ببیند. اگر این فایلها را مسدود کنید، ممکن است گوگل نتواند صفحه را بهدرستی رندر و ارزیابی کند.
اشتباهات رایج در فایل Robots.txt
یکی از خطرناکترین اشتباهات، مسدود کردن کل سایت است. گاهی در زمان طراحی یا توسعه سایت، برنامهنویس برای جلوگیری از ورود گوگل این دستور را قرار میدهد:
User-agent: *
Disallow: /
اگر بعد از راهاندازی سایت این دستور حذف نشود، گوگل اجازه بررسی هیچ صفحهای را نخواهد داشت. این اشتباه میتواند باعث شود سایت شما در گوگل دیده نشود یا صفحات آن بهمرور از نتایج حذف شوند.
اشتباه دوم، استفاده از robots.txt برای جلوگیری از ایندکس صفحات حساس است. اگر صفحهای واقعاً محرمانه است، نباید فقط با robots.txt از آن محافظت کنید. چون این فایل عمومی است و هر کسی میتواند آن را مشاهده کند. برای صفحات حساس باید از رمز عبور، محدودیت دسترسی یا روشهای امنیتی استفاده شود.
اشتباه سوم، مسدود کردن فایلهای CSS و JS است. در گذشته برخی سایتها این فایلها را میبستند، اما امروز گوگل برای تحلیل تجربه کاربری و نمایش صفحه به این فایلها نیاز دارد.
اشتباه چهارم، قرار دادن صفحات noindex در robots.txt است. اگر صفحهای را هم noindex کرده باشید و هم در robots.txt مسدود کرده باشید، ممکن است گوگل نتواند تگ noindex را ببیند، چون اجازه خزش صفحه را ندارد. در نتیجه صفحه ممکن است همچنان در ایندکس باقی بماند.
اشتباه پنجم، نوشتن دستورات اشتباه یا استفاده از مسیرهای نادرست است. حتی یک اسلش یا کاراکتر اشتباه میتواند باعث شود دستور شما آنطور که انتظار دارید عمل نکند.
آیا Robots.txt برای حذف صفحه از گوگل مناسب است؟
اگر صفحهای قبلاً در گوگل ایندکس شده باشد، مسدود کردن آن در robots.txt لزوماً باعث حذف سریع آن از نتایج نمیشود. چون گوگل دیگر اجازه ورود به صفحه را ندارد و نمیتواند ببیند که آیا صفحه حذف شده یا noindex دارد.
برای حذف یک صفحه از گوگل، روشهای مناسبتر عبارتاند از:
- استفاده از تگ
noindex - حذف صفحه و نمایش کد 404 یا 410
- ریدایرکت صفحه به آدرس مرتبط
- استفاده از ابزار Removals در Google Search Console
- محدود کردن دسترسی با رمز عبور برای محتوای خصوصی
پس اگر هدف شما جلوگیری از نمایش در نتایج جستجو است، robots.txt همیشه راهحل اصلی نیست. Robots.txt بیشتر برای مدیریت خزش کاربرد دارد، نه حذف قطعی از ایندکس.
Robots.txt در وردپرس
در وردپرس معمولاً فایل robots.txt بهصورت مجازی ایجاد میشود. یعنی حتی اگر فایل فیزیکی در هاست وجود نداشته باشد، وردپرس میتواند یک نسخه ساده از آن نمایش دهد. برای دیدن آن کافی است آدرس زیر را باز کنید:
https://example.com/robots.txt
اگر از افزونههای سئو مثل Rank Math یا Yoast SEO استفاده میکنید، معمولاً امکان ویرایش فایل robots.txt از داخل پیشخوان وردپرس وجود دارد. البته این کار باید با دقت انجام شود، چون یک دستور اشتباه میتواند روی سئو سایت تأثیر منفی بگذارد.
نمونه robots.txt مناسب برای بسیاری از سایتهای وردپرسی:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
در فروشگاههای ووکامرسی ممکن است لازم باشد مسیرهایی مثل سبد خرید، تسویه حساب و حساب کاربری هم مسدود شوند:
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml
البته آدرس این صفحات ممکن است در سایتهای فارسی متفاوت باشد؛ مثلاً /سبد-خرید/ یا /پرداخت/. بنابراین باید مسیرهای واقعی سایت خود را بررسی کنید.
نحوه تست فایل Robots.txt
بعد از تنظیم robots.txt باید مطمئن شوید که دستورات آن درست کار میکنند. یکی از بهترین ابزارها برای بررسی وضعیت خزش، Google Search Console است. در سرچ کنسول میتوانید ببینید آیا گوگل به صفحات مهم سایت دسترسی دارد یا نه.
همچنین در ابزار URL Inspection میتوانید یک آدرس خاص را بررسی کنید و ببینید آیا توسط robots.txt مسدود شده است یا خیر. اگر صفحهای مهم باشد و گوگل پیام blocked by robots.txt نمایش دهد، یعنی باید تنظیمات فایل را اصلاح کنید.
برای بررسی دستی نیز میتوانید فایل robots.txt را در مرورگر باز کنید و مسیرها را بخوانید. اما برای سایتهای بزرگ، بهتر است از ابزارهای تخصصی سئو مثل Screaming Frog، Sitebulb یا ابزارهای آنلاین robots.txt tester استفاده کنید.
تفاوت Robots.txt با Meta Robots
یکی از موضوعات مهم در سئو، تفاوت robots.txt با متا تگ robots است. این دو ابزار هر دو با رباتهای موتور جستجو ارتباط دارند، اما عملکردشان متفاوت است.
فایل Robots.txt قبل از ورود ربات به صفحه خوانده میشود و میتواند جلوی خزش مسیرها را بگیرد. اما Meta Robots داخل کد HTML صفحه قرار دارد و بعد از ورود ربات به صفحه خوانده میشود.
نمونه متا تگ noindex:
<meta name="robots" content="noindex, follow">
این دستور یعنی ربات میتواند صفحه را بررسی کند و لینکهای آن را دنبال کند، اما خود صفحه را در نتایج ایندکس نکند.
اگر میخواهید صفحهای بررسی شود اما در نتایج نمایش داده نشود، معمولاً noindex انتخاب بهتری است. اما اگر میخواهید ربات اصلاً وارد یک مسیر نشود، robots.txt مناسبتر است.
بهترین نکات برای تنظیم فایل Robots.txt
برای اینکه فایل robots.txt شما اصولی و سئو شده باشد، بهتر است چند نکته مهم را رعایت کنید:
- فایل robots.txt باید در ریشه دامنه قرار داشته باشد.
- فقط مسیرهایی را مسدود کنید که واقعاً نیازی به خزش ندارند.
- صفحات مهم و قابل رتبهگیری را مسدود نکنید.
- فایلهای CSS و JavaScript ضروری را نبندید.
- آدرس نقشه سایت را در robots.txt قرار دهید.
- از robots.txt برای محافظت از اطلاعات محرمانه استفاده نکنید.
- بعد از هر تغییر، فایل را تست کنید.
- مراقب دستور
Disallow: /باشید. - برای حذف از ایندکس، بهجای robots.txt از noindex یا روشهای حذف استفاده کنید.
- تنظیمات سایتهای فروشگاهی و بزرگ را با دقت بیشتری انجام دهید.
جمعبندی
فایل Robots.txt یکی از مهمترین فایلهای سئو تکنیکال است که به رباتهای گوگل و سایر موتورهای جستجو دستور میدهد کدام بخشهای سایت را بررسی کنند و از کدام بخشها عبور کنند. این فایل در ریشه سایت قرار میگیرد و با دستورهایی مثل User-agent، Disallow، Allow و Sitemap رفتار خزندهها را مدیریت میکند.
نکته مهم این است که Robots.txt بیشتر برای کنترل خزش یا Crawling استفاده میشود، نه حذف قطعی صفحات از ایندکس گوگل. اگر میخواهید صفحهای در نتایج گوگل نمایش داده نشود، بهتر است از تگ noindex یا روشهای حذف صفحه استفاده کنید. اما اگر میخواهید رباتها وارد بخشهایی مثل پنل مدیریت، سبد خرید، صفحات فیلتر یا مسیرهای غیرضروری نشوند، robots.txt ابزار بسیار مفیدی است.
تنظیم درست فایل robots.txt میتواند به بهینهسازی بودجه خزش، تمرکز گوگل روی صفحات مهم، کاهش بررسی صفحات بیارزش و بهبود ساختار فنی سایت کمک کند. در مقابل، یک اشتباه کوچک در این فایل ممکن است باعث شود گوگل به صفحات اصلی سایت دسترسی نداشته باشد و عملکرد سئو شما آسیب ببیند.
در نهایت، Robots.txt مانند تابلوی راهنمای ورودی سایت برای رباتهای گوگل است. اگر این تابلو دقیق، تمیز و اصولی نوشته شود، موتورهای جستجو مسیر درست را پیدا میکنند و سایت شما بهتر بررسی میشود. بنابراین اگر به سئو سایت خود اهمیت میدهید، فایل robots.txt را جدی بگیرید و آن را بهصورت حرفهای و متناسب با ساختار سایت خود تنظیم کنید.
