抓取、索引和排名是多语言网站优化中三个先后发生、判断依据完全不同的环节。抓取是搜索引擎发现并读取URL;索引是它把页面内容存入可供检索的库;排名是用户搜索某个词时,页面在结果中的位置。时间人手有限时,先判断卡在哪一环,再决定做什么,否则容易把排名问题当成收录问题反复提交,或把抓取问题当成内容质量问题反复改文案。
假设你有一个中英双语站点,英文页面放在/en/目录下,中文页面放在/zh/目录下,两套页面主题相近但各自面向不同语言的用户。上线两周后,你发现英文页面在英文搜索里几乎看不到,于是开始怀疑内容写得不好。
更合理的排查顺序是:
/en/下的地址,或看搜索后台的抓取统计中是否出现这些URL。site:查询或搜索后台的页面收录状态,看具体英文URL能否被检索到。查不到,说明问题在抓取或索引,不在排名。这个顺序的价值在于:每一步的结论决定下一步做什么。没被抓取就改内容,等于跳过了入口问题。
抓取环节要看的信号:服务器日志中爬虫请求的状态码、robots.txt是否误屏蔽了/en/、页面是否返回200而不是301跳回中文页、内链是否指向英文版本。如果日志里长期没有爬虫访问英文目录,先查屏蔽规则和跳转配置,而不是改标题。
索引环节要看的信号:搜索后台中该URL的状态是“已编入索引”还是“已发现但未编入索引”“已抓取但未编入索引”。前者说明可以进入排名竞争;后两者说明还停在索引门前,需要检查内容是否与已有页面高度重复、是否有明确的canonical指向了别的语言版本、页面是否对搜索引擎可见。
排名环节要看的信号:该URL是否对目标词有展现、平均位置大约在什么区间、点击率是否异常低。有展现但位置靠后,通常与内容相关性、页面权威度和竞争程度有关;完全没有展现,则要回头确认索引状态和查询词是否真的匹配页面主题。
多语言网站比单语站多了一层语言与地区的匹配问题,常见错误有三类。
hreflang互相标注,而不是让一个版本canonical到另一个版本。canonical用错,会让被指向的版本之外的语言页面难以进入索引。优先做一次分语言的抓取与索引盘点,而不是先写新内容。具体做法:从搜索后台导出各语言目录的URL状态,把“未索引”和“已抓取未索引”的URL单独列出;再对照服务器日志,看这些URL近期有没有被抓取记录。如果连抓取都没有,先处理robots、跳转和内链;如果有抓取但未索引,先处理canonical、重复度和页面可见性;如果已索引但无排名,再进入关键词与内容质量层面。
判断标准可以简化为一句:没被抓取,改内容无用;没被索引,谈排名过早;已索引无展现,才轮到排名优化。按这个顺序分配人手,能避免在错误的环节反复投入。
下一步建议:选一个你怀疑有问题的语言目录,导出它的URL索引状态清单,按“未抓取、已抓取未索引、已索引”分成三组,只处理数量最多的那一组,处理完再复查看状态是否变化。