آموزشی

فایل دستورالعمل برای ربات‌های گوگل Robots.txt

فایل دستورالعمل برای ربات‌های گوگل Robots.txt

راهنمای کامل دستورالعمل برای ربات‌های گوگل

فایل دستورالعمل برای ربات‌های گوگل Robots.txt،      اگر سایت دارید و به سئو اهمیت می‌دهید، حتماً باید با فایل Robots.txt آشنا باشید. این فایل یکی از مهم‌ترین بخش‌های سئو تکنیکال است و به ربات‌های موتورهای جستجو مثل گوگل اعلام می‌کند که اجازه دارند کدام قسمت‌های سایت را بررسی کنند و از ورود به کدام بخش‌ها خودداری کنند. به زبان ساده، Robots.txt فایل دستورالعمل برای ربات‌های گوگل است که مسیر خزش یا همان Crawling را مدیریت می‌کند.

بسیاری از افراد تصور می‌کنند فایل Robots.txt مستقیماً تعیین می‌کند که کدام بخش سایت در گوگل ایندکس شود یا نشود؛ اما این تعریف کاملاً دقیق نیست. Robots.txt بیشتر برای کنترل خزش ربات‌ها استفاده می‌شود، نه کنترل قطعی ایندکس. یعنی شما با این فایل به ربات گوگل می‌گویید وارد یک مسیر خاص نشود، اما اگر آن صفحه از جای دیگری لینک شده باشد، ممکن است همچنان آدرس آن در نتایج گوگل دیده شود. برای جلوگیری قطعی از ایندکس، معمولاً باید از تگ noindex استفاده کرد.

با این حال، اهمیت robots.txt در سئو بسیار زیاد است. اگر این فایل به‌درستی تنظیم شود، می‌تواند از هدر رفتن بودجه خزش جلوگیری کند، دسترسی ربات‌ها به صفحات بی‌ارزش را محدود کند و به گوگل کمک کند روی صفحات مهم سایت تمرکز بیشتری داشته باشد. اما اگر اشتباه تنظیم شود، ممکن است باعث شود صفحات مهم سایت شما توسط گوگل بررسی نشوند و در نتیجه رتبه و بازدید سایت آسیب ببیند.

فایل Robots.txt چیست؟

Robots.txt یک فایل متنی ساده است که در ریشه اصلی سایت قرار می‌گیرد و دستورالعمل‌هایی را برای ربات‌های موتور جستجو مشخص می‌کند. ربات‌های گوگل، بینگ و سایر موتورهای جستجو قبل از بررسی سایت، معمولاً ابتدا فایل robots.txt را می‌خوانند تا بدانند اجازه ورود به چه بخش‌هایی را دارند.

آدرس این فایل معمولاً به شکل زیر است:

text

 

https://example.com/robots.txt

اگر بخواهید فایل robots.txt سایت خود را ببینید، کافی است بعد از نام دامنه، عبارت /robots.txt را وارد کنید. برای مثال:

text

 

https://yourdomain.com/robots.txt

این فایل می‌تواند بسیار ساده یا نسبتاً پیچیده باشد. در ساده‌ترین حالت، robots.txt مشخص می‌کند که تمام ربات‌ها به همه بخش‌های سایت دسترسی داشته باشند یا برخی مسیرها برای آن‌ها مسدود شود.

نمونه ساده فایل robots.txt:

text

 

User-agent: *
Disallow:

این دستور یعنی همه ربات‌ها اجازه دارند کل سایت را بررسی کنند.

نمونه دیگر:

text

 

User-agent: *
Disallow: /admin/

این دستور یعنی همه ربات‌ها اجازه ندارند وارد مسیر /admin/ شوند.

Robots.txt چه کاربردی دارد؟

کاربرد اصلی فایل Robots.txt مدیریت رفتار ربات‌های موتور جستجو در زمان خزش سایت است. وقتی گوگل‌بات وارد سایت شما می‌شود، با کمک این فایل می‌فهمد کدام مسیرها را بررسی کند و کدام مسیرها را نادیده بگیرد.

مهم‌ترین کاربردهای robots.txt عبارت‌اند از:

  • جلوگیری از خزش صفحات مدیریتی سایت
  • محدود کردن دسترسی ربات‌ها به صفحات کم‌ارزش
  • جلوگیری از بررسی صفحات تکراری یا فیلترهای فروشگاهی
  • مدیریت بودجه خزش یا Crawl Budget
  • معرفی آدرس نقشه سایت به موتورهای جستجو
  • جلوگیری از فشار بیش از حد ربات‌ها روی سرور
  • هدایت بهتر ربات‌ها به سمت صفحات مهم‌تر

برای مثال، در فروشگاه‌های اینترنتی ممکن است صفحات فیلتر زیادی ایجاد شود؛ مثل رنگ، سایز، قیمت، برند و مرتب‌سازی محصولات. اگر همه این صفحات توسط گوگل بررسی شوند، ممکن است بودجه خزش سایت روی صفحات کم‌ارزش مصرف شود. در چنین شرایطی، تنظیم درست robots.txt می‌تواند به بهینه‌سازی خزش کمک کند.

تفاوت Crawling و Indexing در robots.txt

برای درک بهتر robots.txt باید تفاوت دو مفهوم مهم را بدانید: خزش یا Crawling و ایندکس یا Indexing.

خزش یعنی ربات گوگل وارد یک صفحه می‌شود و محتوای آن را بررسی می‌کند. ایندکس یعنی گوگل بعد از بررسی صفحه، تصمیم می‌گیرد آن را در پایگاه داده خود ذخیره کند تا در نتایج جستجو نمایش دهد.

فایل robots.txt بیشتر روی خزش اثر دارد، نه روی ایندکس. یعنی اگر شما صفحه‌ای را در robots.txt مسدود کنید، گوگل نباید آن صفحه را بخزد. اما اگر همان صفحه از سایت‌های دیگر لینک گرفته باشد، گوگل ممکن است آدرس آن را بدون بررسی محتوا در نتایج نمایش دهد.

برای مثال اگر این دستور را بنویسید:

text

 

User-agent: *
Disallow: /private-page/

گوگل نمی‌تواند محتوای صفحه /private-page/ را بررسی کند. اما اگر این صفحه قبلاً ایندکس شده باشد یا از جای دیگری لینک داشته باشد، ممکن است همچنان در نتایج گوگل ظاهر شود، البته معمولاً بدون توضیح کامل.

پس اگر هدف شما این است که صفحه‌ای در نتایج گوگل نمایش داده نشود، robots.txt همیشه بهترین گزینه نیست. برای حذف قطعی از ایندکس باید از روش‌هایی مثل تگ noindex، حذف صفحه، رمزگذاری، یا ابزار Removals در Google Search Console استفاده کنید.

ساختار فایل Robots.txt

فایل robots.txt از چند دستور اصلی تشکیل می‌شود. مهم‌ترین دستورها عبارت‌اند از:

دستور User-agent

دستور User-agent مشخص می‌کند که قوانین برای کدام ربات اعمال شوند. اگر از علامت ستاره * استفاده کنید، یعنی قانون برای همه ربات‌هاست.

مثال:

text

 

User-agent: *

یعنی همه ربات‌های موتورهای جستجو باید این دستورها را رعایت کنند.

اگر بخواهید فقط برای ربات گوگل دستور خاصی بنویسید، می‌توانید از این حالت استفاده کنید:

text

 

User-agent: Googlebot
دستور Disallow

دستور Disallow مشخص می‌کند که ربات اجازه ورود به چه مسیری را ندارد.

مثال:

text

 

User-agent: *
Disallow: /wp-admin/

یعنی همه ربات‌ها اجازه ندارند مسیر /wp-admin/ را بررسی کنند.

اگر Disallow خالی باشد، یعنی ربات‌ها اجازه بررسی همه بخش‌ها را دارند:

text

 

User-agent: *
Disallow:

اما اگر به شکل زیر نوشته شود:

text

 

User-agent: *
Disallow: /

یعنی همه ربات‌ها از بررسی کل سایت منع می‌شوند. این دستور بسیار خطرناک است و اگر اشتباهی در سایت فعال باشد، می‌تواند باعث افت شدید ایندکس و بازدید سایت شود.

دستور Allow

دستور Allow معمولاً برای اجازه دادن به یک مسیر خاص داخل مسیری استفاده می‌شود که به‌طور کلی مسدود شده است.

مثال:

text

 

User-agent: *
Disallow: /folder/
Allow: /folder/important-page.html

در این مثال، کل مسیر /folder/ مسدود است، اما صفحه important-page.html داخل همان مسیر اجازه خزش دارد.

دستور Sitemap

با دستور Sitemap می‌توانید آدرس نقشه سایت را به ربات‌ها معرفی کنید. این کار به موتورهای جستجو کمک می‌کند صفحات مهم سایت را راحت‌تر پیدا کنند.

مثال:

text

 

Sitemap: https://example.com/sitemap.xml

معمولاً توصیه می‌شود آدرس نقشه سایت در فایل robots.txt قرار بگیرد، حتی اگر آن را در Google Search Console هم ثبت کرده باشید.

فایل دستورالعمل برای ربات‌های گوگل Robots.txt

نمونه فایل Robots.txt استاندارد

یک نمونه ساده و استاندارد برای بسیاری از سایت‌های وردپرسی می‌تواند شبیه زیر باشد:

text

 

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

در این نمونه، دسترسی به بخش مدیریت وردپرس محدود شده، اما فایل admin-ajax.php که ممکن است برای عملکرد برخی بخش‌های سایت لازم باشد، مجاز است. همچنین نقشه سایت به موتورهای جستجو معرفی شده است.

برای سایت‌های فروشگاهی، ممکن است تنظیمات پیچیده‌تر باشد. مثلاً برخی صفحات فیلتر، سبد خرید، حساب کاربری و پرداخت بهتر است توسط ربات‌ها بررسی نشوند:

text

 

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /*?orderby=
Disallow: /*?filter=

Sitemap: https://example.com/sitemap.xml

البته این موارد باید با دقت و بر اساس ساختار سایت تنظیم شوند. مسدود کردن اشتباه پارامترها یا مسیرها ممکن است باعث شود صفحات مهم سایت از دسترس گوگل خارج شوند.

اهمیت Robots.txt در سئو تکنیکال

فایل robots.txt بخش مهمی از سئو تکنیکال است، زیرا روی نحوه تعامل ربات‌های موتور جستجو با سایت اثر می‌گذارد. اگر سایت شما کوچک باشد و فقط چند صفحه داشته باشد، شاید اهمیت این فایل کمتر احساس شود. اما برای سایت‌های بزرگ، فروشگاه‌های اینترنتی، سایت‌های خبری و پورتال‌ها، robots.txt می‌تواند نقش بسیار مهمی داشته باشد.

یکی از مفاهیم مهم در این زمینه، بودجه خزش یا Crawl Budget است. گوگل برای هر سایت مقدار مشخصی زمان و منابع برای خزش در نظر می‌گیرد. اگر ربات گوگل وقت خود را صرف بررسی صفحات بی‌ارزش، تکراری یا غیرضروری کند، ممکن است صفحات مهم سایت دیرتر بررسی شوند.

با تنظیم درست robots.txt می‌توانید مسیرهای کم‌اهمیت را از دسترس ربات‌ها خارج کنید و کاری کنید که گوگل بیشتر روی صفحات ارزشمند تمرکز کند. این موضوع به‌خصوص برای سایت‌هایی با هزاران یا میلیون‌ها URL اهمیت زیادی دارد.

از طرف دیگر، robots.txt می‌تواند جلوی خزش بخش‌هایی را بگیرد که نیازی نیست در گوگل بررسی شوند؛ مثل صفحات ورود، ثبت‌نام، سبد خرید، پنل کاربری، صفحات جستجوی داخلی و مسیرهای مدیریتی.

چه صفحاتی را بهتر است در Robots.txt مسدود کنیم؟

همه صفحات سایت نباید در دسترس ربات‌های گوگل باشند. برخی مسیرها ارزش سئویی ندارند و خزش آن‌ها فقط منابع گوگل و سرور را مصرف می‌کند.

صفحاتی که معمولاً می‌توان در robots.txt مسدود کرد:

  • صفحات مدیریت سایت
  • صفحات ورود و ثبت‌نام
  • سبد خرید و پرداخت
  • پنل کاربری
  • صفحات جستجوی داخلی سایت
  • برخی پارامترهای فیلتر در فروشگاه‌ها
  • صفحات تستی و موقت
  • فایل‌ها یا مسیرهای غیرضروری
  • نتایج مرتب‌سازی محصولات در صورت ایجاد URLهای تکراری

اما باید مراقب باشید صفحات مهم را مسدود نکنید. برای مثال نباید دسته‌بندی‌های اصلی، صفحات محصولات، مقالات، صفحات خدمات یا فایل‌های ضروری CSS و JavaScript را بدون دلیل ببندید. گوگل برای درک کامل صفحه نیاز دارد فایل‌های CSS و JS را ببیند. اگر این فایل‌ها را مسدود کنید، ممکن است گوگل نتواند صفحه را به‌درستی رندر و ارزیابی کند.

اشتباهات رایج در فایل Robots.txt

یکی از خطرناک‌ترین اشتباهات، مسدود کردن کل سایت است. گاهی در زمان طراحی یا توسعه سایت، برنامه‌نویس برای جلوگیری از ورود گوگل این دستور را قرار می‌دهد:

text

 

User-agent: *
Disallow: /

اگر بعد از راه‌اندازی سایت این دستور حذف نشود، گوگل اجازه بررسی هیچ صفحه‌ای را نخواهد داشت. این اشتباه می‌تواند باعث شود سایت شما در گوگل دیده نشود یا صفحات آن به‌مرور از نتایج حذف شوند.

اشتباه دوم، استفاده از robots.txt برای جلوگیری از ایندکس صفحات حساس است. اگر صفحه‌ای واقعاً محرمانه است، نباید فقط با robots.txt از آن محافظت کنید. چون این فایل عمومی است و هر کسی می‌تواند آن را مشاهده کند. برای صفحات حساس باید از رمز عبور، محدودیت دسترسی یا روش‌های امنیتی استفاده شود.

اشتباه سوم، مسدود کردن فایل‌های CSS و JS است. در گذشته برخی سایت‌ها این فایل‌ها را می‌بستند، اما امروز گوگل برای تحلیل تجربه کاربری و نمایش صفحه به این فایل‌ها نیاز دارد.

اشتباه چهارم، قرار دادن صفحات noindex در robots.txt است. اگر صفحه‌ای را هم noindex کرده باشید و هم در robots.txt مسدود کرده باشید، ممکن است گوگل نتواند تگ noindex را ببیند، چون اجازه خزش صفحه را ندارد. در نتیجه صفحه ممکن است همچنان در ایندکس باقی بماند.

اشتباه پنجم، نوشتن دستورات اشتباه یا استفاده از مسیرهای نادرست است. حتی یک اسلش یا کاراکتر اشتباه می‌تواند باعث شود دستور شما آن‌طور که انتظار دارید عمل نکند.

آیا Robots.txt برای حذف صفحه از گوگل مناسب است؟

اگر صفحه‌ای قبلاً در گوگل ایندکس شده باشد، مسدود کردن آن در robots.txt لزوماً باعث حذف سریع آن از نتایج نمی‌شود. چون گوگل دیگر اجازه ورود به صفحه را ندارد و نمی‌تواند ببیند که آیا صفحه حذف شده یا noindex دارد.

برای حذف یک صفحه از گوگل، روش‌های مناسب‌تر عبارت‌اند از:

  • استفاده از تگ noindex
  • حذف صفحه و نمایش کد 404 یا 410
  • ریدایرکت صفحه به آدرس مرتبط
  • استفاده از ابزار Removals در Google Search Console
  • محدود کردن دسترسی با رمز عبور برای محتوای خصوصی

پس اگر هدف شما جلوگیری از نمایش در نتایج جستجو است، robots.txt همیشه راه‌حل اصلی نیست. Robots.txt بیشتر برای مدیریت خزش کاربرد دارد، نه حذف قطعی از ایندکس.

Robots.txt در وردپرس

در وردپرس معمولاً فایل robots.txt به‌صورت مجازی ایجاد می‌شود. یعنی حتی اگر فایل فیزیکی در هاست وجود نداشته باشد، وردپرس می‌تواند یک نسخه ساده از آن نمایش دهد. برای دیدن آن کافی است آدرس زیر را باز کنید:

text

 

https://example.com/robots.txt

اگر از افزونه‌های سئو مثل Rank Math یا Yoast SEO استفاده می‌کنید، معمولاً امکان ویرایش فایل robots.txt از داخل پیشخوان وردپرس وجود دارد. البته این کار باید با دقت انجام شود، چون یک دستور اشتباه می‌تواند روی سئو سایت تأثیر منفی بگذارد.

نمونه robots.txt مناسب برای بسیاری از سایت‌های وردپرسی:

text

 

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

در فروشگاه‌های ووکامرسی ممکن است لازم باشد مسیرهایی مثل سبد خرید، تسویه حساب و حساب کاربری هم مسدود شوند:

text

 

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php

Sitemap: https://example.com/sitemap_index.xml

البته آدرس این صفحات ممکن است در سایت‌های فارسی متفاوت باشد؛ مثلاً /سبد-خرید/ یا /پرداخت/. بنابراین باید مسیرهای واقعی سایت خود را بررسی کنید.

نحوه تست فایل Robots.txt

بعد از تنظیم robots.txt باید مطمئن شوید که دستورات آن درست کار می‌کنند. یکی از بهترین ابزارها برای بررسی وضعیت خزش، Google Search Console است. در سرچ کنسول می‌توانید ببینید آیا گوگل به صفحات مهم سایت دسترسی دارد یا نه.

همچنین در ابزار URL Inspection می‌توانید یک آدرس خاص را بررسی کنید و ببینید آیا توسط robots.txt مسدود شده است یا خیر. اگر صفحه‌ای مهم باشد و گوگل پیام blocked by robots.txt نمایش دهد، یعنی باید تنظیمات فایل را اصلاح کنید.

برای بررسی دستی نیز می‌توانید فایل robots.txt را در مرورگر باز کنید و مسیرها را بخوانید. اما برای سایت‌های بزرگ، بهتر است از ابزارهای تخصصی سئو مثل Screaming Frog، Sitebulb یا ابزارهای آنلاین robots.txt tester استفاده کنید.

تفاوت Robots.txt با Meta Robots

یکی از موضوعات مهم در سئو، تفاوت robots.txt با متا تگ robots است. این دو ابزار هر دو با ربات‌های موتور جستجو ارتباط دارند، اما عملکردشان متفاوت است.

فایل Robots.txt قبل از ورود ربات به صفحه خوانده می‌شود و می‌تواند جلوی خزش مسیرها را بگیرد. اما Meta Robots داخل کد HTML صفحه قرار دارد و بعد از ورود ربات به صفحه خوانده می‌شود.

نمونه متا تگ noindex:

HTML

 

<meta name="robots" content="noindex, follow">

این دستور یعنی ربات می‌تواند صفحه را بررسی کند و لینک‌های آن را دنبال کند، اما خود صفحه را در نتایج ایندکس نکند.

اگر می‌خواهید صفحه‌ای بررسی شود اما در نتایج نمایش داده نشود، معمولاً noindex انتخاب بهتری است. اما اگر می‌خواهید ربات اصلاً وارد یک مسیر نشود، robots.txt مناسب‌تر است.

بهترین نکات برای تنظیم فایل Robots.txt

برای اینکه فایل robots.txt شما اصولی و سئو شده باشد، بهتر است چند نکته مهم را رعایت کنید:

  • فایل robots.txt باید در ریشه دامنه قرار داشته باشد.
  • فقط مسیرهایی را مسدود کنید که واقعاً نیازی به خزش ندارند.
  • صفحات مهم و قابل رتبه‌گیری را مسدود نکنید.
  • فایل‌های CSS و JavaScript ضروری را نبندید.
  • آدرس نقشه سایت را در robots.txt قرار دهید.
  • از robots.txt برای محافظت از اطلاعات محرمانه استفاده نکنید.
  • بعد از هر تغییر، فایل را تست کنید.
  • مراقب دستور Disallow: / باشید.
  • برای حذف از ایندکس، به‌جای robots.txt از noindex یا روش‌های حذف استفاده کنید.
  • تنظیمات سایت‌های فروشگاهی و بزرگ را با دقت بیشتری انجام دهید.

جمع‌بندی

فایل Robots.txt یکی از مهم‌ترین فایل‌های سئو تکنیکال است که به ربات‌های گوگل و سایر موتورهای جستجو دستور می‌دهد کدام بخش‌های سایت را بررسی کنند و از کدام بخش‌ها عبور کنند. این فایل در ریشه سایت قرار می‌گیرد و با دستورهایی مثل User-agent، Disallow، Allow و Sitemap رفتار خزنده‌ها را مدیریت می‌کند.

نکته مهم این است که Robots.txt بیشتر برای کنترل خزش یا Crawling استفاده می‌شود، نه حذف قطعی صفحات از ایندکس گوگل. اگر می‌خواهید صفحه‌ای در نتایج گوگل نمایش داده نشود، بهتر است از تگ noindex یا روش‌های حذف صفحه استفاده کنید. اما اگر می‌خواهید ربات‌ها وارد بخش‌هایی مثل پنل مدیریت، سبد خرید، صفحات فیلتر یا مسیرهای غیرضروری نشوند، robots.txt ابزار بسیار مفیدی است.

تنظیم درست فایل robots.txt می‌تواند به بهینه‌سازی بودجه خزش، تمرکز گوگل روی صفحات مهم، کاهش بررسی صفحات بی‌ارزش و بهبود ساختار فنی سایت کمک کند. در مقابل، یک اشتباه کوچک در این فایل ممکن است باعث شود گوگل به صفحات اصلی سایت دسترسی نداشته باشد و عملکرد سئو شما آسیب ببیند.

در نهایت، Robots.txt مانند تابلوی راهنمای ورودی سایت برای ربات‌های گوگل است. اگر این تابلو دقیق، تمیز و اصولی نوشته شود، موتورهای جستجو مسیر درست را پیدا می‌کنند و سایت شما بهتر بررسی می‌شود. بنابراین اگر به سئو سایت خود اهمیت می‌دهید، فایل robots.txt را جدی بگیرید و آن را به‌صورت حرفه‌ای و متناسب با ساختار سایت خود تنظیم کنید.

این مطلب چه اندازه برایتان مفید بوده است؟

میانگین امتیاز 0 / 5. تعداد رأی: 0

تا حالا کسی رأی نداده! اولین نفر باشید.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *