خزش، ایندکس و رتبه: سه مرحله جدا
بسیاری از خطاهای فنی از یکی دانستن این سه مرحله ناشی میشوند. خزش (Crawl) یعنی ربات گوگل آدرس را پیدا کند و محتوای آن را دریافت کند. ایندکس (Index) یعنی گوگل تصمیم بگیرد آن صفحه را در پایگاه دادهاش نگه دارد. رتبهبندی مرحله سوم است و فقط برای صفحههای ایندکسشده معنا دارد.
هر ابزار فنی روی یکی از این مراحل اثر میگذارد و نباید بهجای دیگری به کار برود:
- robots.txt خزش را کنترل میکند، نه ایندکس را؛ آدرسی که در robots.txt مسدود شده، اگر از جای دیگری لینک گرفته باشد، ممکن است بدون محتوا در نتایج ظاهر شود.
- متاتگ noindex جلوی ایندکس را میگیرد، اما گوگل فقط وقتی آن را میبیند که اجازه خزش صفحه را داشته باشد؛ مسدود کردن همزمان صفحه در robots.txt و گذاشتن noindex روی آن، عملاً noindex را بیاثر میکند.
- تگ canonical یک پیشنهاد است، نه دستور؛ اگر لینکهای داخلی، نقشه سایت و ریدایرکتها نسخه دیگری را نشان دهند، گوگل ممکن است canonical شما را نادیده بگیرد.
گزارش «صفحهها» در سرچ کنسول و ابزار URL Inspection نقطه شروع تشخیصاند، چون نشان میدهند گوگل هر آدرس را در کدام مرحله متوقف کرده است.