第一步不是搜站名,而是看状态码
在浏览器里“看起来能打开”不代表爬虫能取得相同内容。登录态、地区规则、Bot 防护和 CDN 挑战都可能让普通浏览器看到正文,却向匿名请求返回 403。
用无登录窗口访问首页,再用 curl 检查响应状态。首页应返回 200;永久迁移使用 301 或 308。不要用 403 当作限速手段。
- 检查首页:curl -I https://你的域名/
- 检查爬虫入口:curl -I https://你的域名/robots.txt
- 检查网址清单:curl -I https://你的域名/sitemap.xml
- 若任一地址返回 4xx/5xx,先修托管或防火墙,再谈内容排名。
确认 robots.txt 说的是你想说的话
robots.txt 用于管理抓取,不是隐藏网页的可靠方式。公开内容站通常允许主要爬虫访问,并在文件中写入完整的 sitemap 地址。
尤其要检查部署预览环境留下的 Disallow: /、登录保护或 noindex 是否被带到正式环境。
Sitemap 只放规范网址
站点地图应使用完整绝对地址,并只列出你希望出现在搜索结果中的规范版本。如果同一内容同时存在测试域名、自定义域名和带参数地址,统一 canonical 与 sitemap,避免搜索引擎猜测主版本。
最后才是提交与观察
在 Search Console 验证域名后提交 sitemap,并用网址检查工具测试实时页面。提交站点地图只是发现提示,不保证收录;内容质量、重复度和站点可用性仍会影响结果。
新站不要每天反复改日期或批量提交。记录首次发现、首次抓取、首次收录和获得展示的时间,按周判断趋势。