技术 SEO 的目标是消除矛盾信号
一个页面可以同时出现这些问题:标题说建站指南,H1 写产品名称,canonical 指向首页,robots 设置 noindex,站点地图却又包含它。单独看每项都有配置,合在一起搜索引擎却无法判断。页面 SEO 优化不是多加标签,而是让内容、链接、索引规则和首选 URL 讲同一件事。 先选三类真实页面检查:文章、分类页、后台或搜索结果页。只看首页会漏掉模板级错误。
标题、描述和 H1 各有分工
SEO title 用于搜索结果和浏览器标签,应准确描述页面主题并与其他页面区分。H1 是页面内主标题,可以更自然、更完整;两者不必逐字相同,但不能表达不同主题。描述用于帮助用户判断是否值得点击,不是关键词仓库,也不保证一定按原文展示。 每页输出一个清楚 H1。页面模板不要把 Logo、栏目名和文章标题都标成 H1。标题长度不要机械追求某个字符数,先保证核心主题靠前、品牌不过度重复、手机搜索结果中仍能理解。
Canonical 先解决‘哪一个 URL 是首选’
同一内容可能通过带参数、大小写、末尾斜杠、打印版或多个语言路径访问。选择一个稳定首选 URL,并在重复版本输出指向它的 rel=canonical。canonical 应使用绝对地址、返回 200、允许索引,且不要指向与当前内容不相干的页面。 能永久合并的重复地址优先重定向。canonical 是信号,不是访问控制;敏感后台必须依靠身份验证,测试页要用网络隔离或 noindex,而不是指望 canonical 隐藏。站点地图只列首选、可索引、返回成功的 URL。
robots、状态码与站点地图要一致
公开文章返回 200 且 indexable;已删除且无替代内容返回 404 或 410;永久迁移使用 301 或 308。软 404——页面显示不存在却返回 200——会浪费抓取和误导监控。 robots.txt 控制抓取范围,不等于保证不被索引。需要登录的后台直接鉴权;草稿和审核页不进入公开链接与站点地图,并输出 noindex。不要在 robots.txt 屏蔽一个你又希望搜索引擎看到 noindex 的页面,因为被阻止抓取后它可能读不到标签。
结构化数据必须与页面可见内容一致
文章页可以使用 Article 或 BlogPosting,并提供真实标题、作者、发布时间、更新时间和主图。面包屑使用 BreadcrumbList。不要为了获得富结果添加页面上不存在的评分、问答或价格;结构化数据通过验证也不代表一定展示。 多语言页面分别使用自己的标题、描述和正文,通过 hreflang 互相指向,并提供自引用。机器翻译未审核的版本不要急着索引,避免中文完整、英文残缺却同时公开。
用抓取结果做一张逐页表
| 检查项 | 正常结果 | 常见错误 |
|---|---|---|
| 状态码 | 首选页 200 | 重定向链、软 404 |
| title / H1 | 主题一致且唯一 | 模板全站重复 |
| canonical | 指向可索引首选页 | 指向首页或 404 |
| robots | 与发布状态一致 | 草稿可索引 |
| sitemap | 只含首选公开页 | 包含参数与后台 |
| structured data | 与可见内容一致 | 虚构字段 |
不要只看源代码模板,要请求线上最终 HTML。JavaScript、反向代理和环境变量都可能让生产输出与本地不同。
发布前的最小验收
抽查 10 个 URL,覆盖中英文、文章、分类、404 和重定向;验证每个页面的状态码、索引指令、canonical、标题与结构化数据。再检查站点地图里没有 pending、draft、admin 或搜索参数页。 技术清单通过后,SEO 才进入真正的数据阶段。下一篇不再修改标签,而是用 网站上线后 30 天迭代计划 判断抓取、展示、点击与内容问题。
参考来源
- SEO Starter GuideGoogle Search Central
- How to specify a canonical URL with rel=canonical and other methodsGoogle Search Central