新网站上线以后,经常会碰到一个比较头疼的问题:
页面一直不收录。
网站已经做好了。
Google Search Console 也添加了。
Sitemap 提交了。
文章也更新了一些。
但是过了几天甚至几周,搜索自己的页面还是看不到。
然后就开始每天:
提交 URL;
重新提交 Sitemap;
修改文章;
改 Title;
找外链;
甚至怀疑是不是域名有问题。
其实新站不收录,并不是只有一个原因。
有的网站是:
Google 根本还没有发现这个 URL。
有的是:
URL 已经发现了,但是还没有抓取。
还有的是:
Google 已经抓过页面,但是暂时没有放进索引。
也有一些比较直接的技术问题,比如:
robots.txt 把页面挡住了;
页面存在 noindex;
canonical 指向其他页面;
页面一直跳转;
服务器返回错误;
页面实际上是空的。
所以排查收录问题的时候,我个人不太建议一上来就研究:
“怎么样让 Google 秒收?”
先把流程搞清楚。
一个页面正常进入 Google,大概会经历:
发现 URL → 抓取页面 → 处理页面 → 判断规范版本 → 判断是否进入索引
所以新站不收录,也应该按照这个顺序查。
先看:
Google知不知道这个页面。
然后看:
Google能不能正常访问。
最后再看:
Google抓完以后,为什么没有选择索引。
这样排查会清楚很多。
一、先搞懂:不收录和没排名不是同一个问题
这个问题新手经常混在一起。
比如网站做的是:
fiber laser cutting machine
然后去 Google 搜这个关键词。
翻了十几页都没有找到自己的网站。
于是觉得:
“我的产品页面没有收录。”
其实不一定。
有可能页面已经进入 Google 索引,只是这个关键词暂时没有排名,或者排名比较靠后。
所以判断一个具体 URL 有没有进入 Google,我一般不会只搜索目标关键词。
最直接的方法还是看GSC网址检查
进入:
Google Search Console → 网址检查 / URL Inspection
输入具体 URL。
例如:
然后看 Google 给出的状态。
这里通常比自己不停使用:
site:example.com
更加适合排查单个页面。
Google Search Console 的 Page Indexing 报告会区分不同未索引原因,例如 Crawled – currently not indexed、Discovered – currently not indexed、noindex、重定向以及服务器错误等。
页面被索引,也不代表一定有排名
这个区别一定要先搞明白:
索引解决的是:Google有没有把这个页面放进自己的索引系统。
排名解决的是:用户搜索某个关键词时,这个页面排在哪里。
一个页面完全可以:
已经索引;
但是没有核心词排名。
也可能:
核心词没有排名;
却已经有很多长尾词曝光。
所以真正排查“新站为什么不收录”,第一步先确定:
它到底是真的没索引,还是只是暂时没排名。
二、为什么新站特别容易出现收录慢?
新站上线后出现部分页面没有马上进入索引,其实并不奇怪。
因为对 Google 来说,这个网站很多东西都是新的。
比如:
新域名;
新网站;
新页面;
新网站结构;
新的内部链接关系;
新的内容主题。
而且很多新站刚上线的时候,还有一个共同特点:
外部链接比较少。
Google 可以通过很多方式发现页面,比如 Sitemap、网站内部链接以及外部链接。
老网站可能已经有:
大量页面;
很多历史链接;
经常被 Googlebot 访问;
外部网站不断引用。
新网站往往没有这些基础。
所以 Google 发现和重新访问新页面的速度可能就没有成熟网站那么快。
新站外链少,发现页面可能比较慢
这里不是说:
新站不收录就必须马上买外链。
而是要理解:
外部链接本身也是搜索引擎发现页面的一种入口。
如果新网站完全没有任何外部引用,那么更应该先把:
Sitemap;
网站导航;
分类;
内部链接
做好。
至少保证 Google 从已经知道的页面里面,能够继续找到其他重要页面。
没有内链的页面更容易被忽略
比如网站有一篇文章:
example.com/laser-cutting-machine-price/
这个页面:
Sitemap 里面有;
你自己知道 URL;
但是网站首页没有;
Blog 列表没有;
分类页面没有;
旧文章也没有任何链接过去。
这种页面就是比较典型的:
孤儿页面。
Google可能通过 Sitemap 知道它存在。
但是从网站结构来看,这个页面并没有得到多少内部支持。
所以新站做内容的时候,不要只负责:
“发布页面。”
还应该考虑:
发布以后谁链接它?
三、第一步:先用GSC网址检查,看页面到底卡在哪里
排查的时候,我个人比较建议先不要改任何东西。
先把 URL 放到 GSC 的网址检查工具里面。
因为不同状态对应的处理方法不一样。
如果连状态都没看,就直接:
改 Title;
提交 Sitemap;
增加外链;
很容易做错方向。
可以重点看几个地方
URL是否在Google上
先判断页面是不是已经进入索引。
如果已经在 Google 上,就不属于单纯的“不收录”问题。
Google有没有抓取过
看看:
Last crawl。
如果连抓取日期都没有,需要先看发现和抓取。
是否允许索引
看:
Indexing allowed?
如果这里因为 noindex 显示不允许索引,就先去解决 noindex。
用户声明的canonical是什么
也就是:
User-declared canonical。
Google选择的canonical是什么
也就是:
Google-selected canonical。
如果自己希望收录 A 页面。
Google最后却选择 B 页面作为 canonical,那就要检查规范化问题。
不同状态不要使用同一种解决办法
例如:
Discovered – currently not indexed
和:
Crawled – currently not indexed
虽然中文看起来都属于:
“尚未编入索引。”
但是实际完全不是一个阶段。
前者 Google 还没有真正抓取页面。
后者 Google 已经抓取过页面,只是目前没有放入索引。
Google 官方目前也是这样分别定义这两个状态。
所以后面我们分开讲。
四、第二步:确认URL是不是正常返回200
如果一个页面希望 Google 正常索引,首先它应该是一个真正可以访问的正常页面。
最基础的就是检查:
HTTP状态码。
普通正常页面一般应该返回:
200 OK
如果返回其他状态,就需要先判断这个状态是不是符合自己的预期。
404
404 表示页面不存在。
例如你自己访问:
example.com/product-a/
看起来页面已经删掉了。
服务器也返回404。
那 Google 正常情况下当然不会把这个 URL 当作普通有效内容长期索引。
如果页面本来就不存在,404没什么奇怪。
问题是:
这个页面本来应该存在,却错误返回了404。
这种就要先修页面。
301或302
如果 URL 本身已经跳转到另外一个页面。
例如:
A → 301 → B
那 Google 更可能处理的是:
B 页面。
所以看到:
Page with redirect
不要一直要求 Google 收录原来的 A。
先确认这个跳转本身是不是自己想要的。
403
403一般表示:
服务器拒绝访问。
有时候自己浏览器访问没有问题,但是:
Cloudflare;
服务器防火墙;
安全插件;
Bot Protection
可能对 Googlebot 产生错误限制。
Google Search Console 对 403 的说明也很直接:如果 Googlebot 被拒绝访问,该页面无法正常被索引。
5xx
例如:
500;
502;
503。
这些属于服务器端错误。
如果 Google 来抓页面的时候,经常碰到服务器报错,自然会影响正常抓取。
这个时候应该先解决:
服务器;
PHP;
数据库;
CDN;
缓存;
程序错误。
而不是继续写更多文章。
新站最好检查几个重要页面
比如:
首页;
产品分类;
主要产品;
Blog;
核心文章。
确认这些页面:
正常打开;
没有跳转错误;
没有服务器错误;
返回200。
基础先稳定下来。
五、第三步:检查robots.txt有没有把Google挡住
robots.txt 是新站收录里面比较常见的技术问题。
尤其是:
开发站;
测试站;
网站改版以后正式上线。
开发的时候为了避免搜索引擎抓测试内容,经常会设置比较严格的 robots 规则。
正式上线以后如果忘记改回来,就可能出现:
网站什么都做好了;
Google却根本没办法正常抓取重要目录。
一个特别明显的错误
比如:
User-agent: *
Disallow: /
这个规则基本就是告诉爬虫:
整个网站都不要抓。
如果正式网站还留着这种配置,那就要处理。
robots.txt主要控制的是抓取
这里很容易理解错。
robots.txt 主要是在告诉搜索引擎:
哪些URL可以请求,哪些URL不要请求。
它不是专门用来控制普通网页“是否进入索引”的工具。
Google 官方也明确区分了 robots.txt 和 noindex:robots.txt 用于控制抓取;如果明确不希望网页进入 Google Search,更适合使用 noindex 等索引控制方式。
不要随便复制别人的robots.txt
网上经常能看到:
“WordPress最佳robots.txt模板。”
复制进去以后有几十条规则。
但是自己根本不知道每一条是什么意思。
其实普通企业站或者小型 WordPress 网站没有必要一开始就配置得特别复杂。
最重要的是:
不要错误屏蔽自己真正需要收录的页面。
例如:
Products;
Blog;
分类页;
重要图片资源。
六、第四步:检查页面有没有noindex
如果 robots.txt 没问题,下一步重点检查:
noindex。
这个问题很直接。
页面可以访问。
Google也能够抓取。
但是 HTML 里面告诉 Google:
不要索引这个页面。
那页面自然不会进入正常索引。
Google 官方说明,noindex 可以通过 robots meta tag 或 HTTP response header 设置;当 Googlebot 抓取页面并读取到该规则后,页面会被排除出 Google Search。
WordPress特别容易在哪里出现?
设置 → 阅读
WordPress 后台有一个类似:
建议搜索引擎不索引本站
的设置。
测试网站的时候经常会勾。
网站正式上线后一定检查有没有取消。
SEO插件
例如:
Yoast SEO;
Rank Math。
这些插件都可以针对:
文章;
页面;
分类;
标签;
产品;
产品分类
设置索引规则。
有时候只是某一种 Content Type 被整体设置成了 noindex。
还有X-Robots-Tag
有些 noindex 并不是写在 HTML <meta> 里面。
而是在服务器返回的 HTTP Header:
X-Robots-Tag
里面设置。
所以如果源码里面明明没看到 noindex,但是 GSC 还是提示被 noindex 排除,可以继续查响应头。
一个容易搞反的地方
如果页面被 robots.txt 完全禁止抓取,Googlebot可能根本看不到页面里面的 noindex。
所以不要使用:
robots.txt禁止抓取 + 希望Google读取noindex
这种互相打架的做法。
Google 官方也特别提醒:noindex 要生效,Googlebot必须能够访问页面并读取该规则。
七、第五步:检查canonical是不是指错页面
canonical 也是导致:
“这个 URL 为什么不收录?”
非常常见的原因。
例如页面:
example.com/product-a/
但是代码里面写:
<link rel="canonical" href="https://example.com/product-b/">
那实际上是在给 Google 一个很明显的信号:
B更适合作为这组相似页面的规范版本。
为什么会出现canonical错误?
常见情况有:
WordPress SEO插件设置错误;
测试域名没有换干净;
HTTP和HTTPS混乱;
www和非www混乱;
参数URL;
产品筛选;
多语言插件配置;
模板把canonical写死;
复制页面以后忘记修改。
在GSC重点看两个地方
User-declared canonical
自己声明的是谁。
Google-selected canonical
Google最后选择的是谁。
如果两者完全一致,而且就是当前页面,基本比较正常。
如果自己声明 A。
Google长期选择 B。
就需要继续看:
A和B是不是太像;
内部链接主要指向哪个;
Sitemap里面提交哪个;
有没有重定向;
不同页面内容到底有没有明显区别。
canonical不是绝对命令
这一点也要注意。
你写 canonical,不代表 Google 100%必须按照这个选择。
Google会综合不同规范化信号选择代表 URL;官方目前把重定向和 rel="canonical" 视为较强信号,而 Sitemap 属于较弱的 canonical 信号。
所以如果 Google 经常忽略你设置的 canonical,不要只把标签再写一遍。
应该找:
为什么它会觉得另外一个 URL 更像真正的主版本。
八、第六步:提交Sitemap,但不要把Sitemap当成“强制收录工具”
新网站一般建议有 XML Sitemap。
例如 WordPress 常见:
/sitemap_index.xml
或者:
/wp-sitemap.xml
然后提交到:
Google Search Console。
Sitemap主要解决的是发现问题
Sitemap 可以帮助 Google 了解:
网站有哪些重要 URL;
哪些页面是新页面;
哪些发生了更新。
它是一个非常有用的发现入口。
但是这里要注意:
Sitemap成功 ≠ 页面一定收录。
Google仍然会自己进行:
抓取;
规范化;
索引判断。
所以 Search Console 显示 Sitemap:
Success
以后,不要理解成:
“里面500个 URL 理论上都应该收录。”
Sitemap里面最好只放真正希望索引的URL
比如网站里面有:
产品;
文章;
重要分类。
这些可以放。
但是一些低价值页面,比如:
站内搜索结果;
无内容标签;
某些参数页;
测试页面;
重复模板页
本身不准备做搜索流量,就没有必要全部往 Sitemap 里面塞。
Sitemap和canonical最好统一
例如:
Sitemap里面提交 A。
页面 canonical 却指向 B。
这种信号本身就是矛盾的。
Google官方也建议 Sitemap 中包含你希望作为 canonical 的 URL。
九、第七步:确认页面真的有内部链接入口
文档里面这一点很重要,我觉得值得单独讲。
很多网站会出现:
Sitemap有这个URL,但是网站里面根本找不到它。
例如一篇文章发布以后:
没有放入正常分类;
首页没有入口;
文章列表没有;
旧文章没有链接;
相关文章没有;
导航更没有。
只有你自己拿着 URL 才能访问。
这样的页面就是比较典型的孤儿页。
Sitemap不能完全代替内链结构
Sitemap告诉 Google:
“我有这个页面。”
内部链接则同时告诉搜索引擎和用户:
“这个页面和网站里的其他内容有什么关系。”
比如:
首页
↓
产品中心
↓
激光切割机
↓
Fiber Laser Cutting Machine
这种关系比较清楚。
或者:
SEO教程
↓
技术SEO
↓
Google收录
↓
新站不收录排查
这样页面的主题归属比较容易理解。
新文章发布以后,可以顺手做几个内链
比如你刚写:
《新站为什么不收录》
网站已有:
Google Search Console教程;
robots.txt教程;
Sitemap教程;
canonical教程;
SEO新手学习顺序。
这些地方提到收录问题时,就可以链接到新文章。
新文章里面同样可以再链接出去。
这样整个网站不是一篇篇孤立内容,而是慢慢连起来。
十、四种情况要分开:未发现、已发现未抓取、已抓取未索引、被排除
文档里面把不收录问题分成四类,这个分类非常适合新手排查。
不要看到所有“未索引”,都用同一个处理方式。
第一种:Google还没有发现URL
这种情况下重点不是内容质量。
因为 Google 可能还不知道页面存在。
主要检查:
Sitemap;
内部链接;
网站导航;
分类结构;
外部链接。
第二种:已经发现,但是还没有抓取
常见状态:
Discovered – currently not indexed
Google已经知道 URL 存在,但是目前还没有真正抓取。
Google官方目前的解释是:页面已被发现但尚未抓取,通常 Google 原本准备抓取,但预计这可能对网站造成较大抓取负载,因此重新安排抓取时间。
这时候可以继续看:
服务器是不是很慢;
网站是不是大量产生URL;
重要页面内链是不是太弱;
Google是不是把大量抓取资源浪费在参数、筛选、标签等低价值URL上。
如果新网站只有少量页面出现这个状态,也不要当天就判断成严重故障。
第三种:已经抓取,但是没有索引
常见状态:
Crawled – currently not indexed
这个状态要换一个思路。
因为 Google 已经访问过页面。
技术上至少说明:
它曾经能够抓到页面。
Google官方对该状态的描述是:页面已经被抓取,但目前没有进入索引,未来可能会也可能不会进入索引,并不需要因为这个状态不断重复提交抓取。
这时候更应该重点检查:
页面质量;
内容是不是太薄;
是不是重复;
是不是模板页;
canonical;
Soft 404;
页面实际渲染内容。
第四种:页面被排除
这种一般需要看具体排除原因。
比如:
noindex;
canonical;
重复页;
重定向;
404;
Soft 404;
服务器错误;
robots限制。
很多“被排除”其实是正常现象。
例如:
A页面301到B页面。
那A显示:
Page with redirect
本来就是预期结果。
不要看到“Excluded”几个字,就认为必须全部修成Indexed。
十一、已发现但未抓取:重点排查什么?
如果大量重要页面长期停留在:
Discovered – currently not indexed
可以重点看下面几个方面。
1、服务器性能
打开网站是不是经常很慢?
有没有:
超时;
5xx;
数据库错误;
CDN不稳定。
如果服务器本身状态很差,就先把网站稳定下来。
2、网站是不是产生了大量垃圾URL
WordPress和WooCommerce很容易产生:
标签;
分页;
搜索结果;
筛选;
参数;
产品属性;
各种Feed。
例如网站真正有用页面只有500个。
搜索引擎却发现50000个 URL。
自然会增加网站抓取和管理复杂度。
3、重要页面内链是不是太弱
如果页面只有 Sitemap 入口,没有正常内链,可以加强相关页面之间的连接。
4、新站是不是一次发布太多页面
网站刚上线。
第一天发1000篇 AI 内容。
每篇只是:
关键词不同;
正文结构一样。
这种做法很容易让整个网站变得特别臃肿。
与其天天研究怎么让这1000个URL全部收录,不如先问:
这些 URL 真的都有单独存在的价值吗?
十二、已经抓取但不索引:开始重点看内容质量
如果页面是:
Crawled – currently not indexed
而且:
返回200;
robots允许;
没有noindex;
canonical基本正常;
那我觉得就不要一直在技术设置里面来回转了。
应该认真看页面本身。
Google官方关于搜索工作原理的文档明确说明,索引并不是保证发生的;页面抓取完成后仍然要经过内容和规范化等处理,低质量内容、索引规则以及网站设计问题都可能影响索引。
页面是不是太空?
例如一个机械产品页面只有:
产品名称;
一张图片;
一句公司介绍;
Contact Us按钮。
虽然 URL 正常存在。
但是对搜索用户来说,能获取的信息非常少。
如果目标关键词本身竞争比较强,这种页面自然很弱。
用户真正需要的信息有没有?
比如 Fiber Laser Cutting Machine 产品页。
用户可能关心:
机器有哪些功率;
可以切什么材料;
切多厚;
技术参数;
机器尺寸;
激光器品牌;
核心部件;
应用场景;
运行视频;
售后;
交期;
选型方式。
页面连这些基础内容都没有。
却写了1000字:
“Our company is a professional manufacturer……”
这种内容数量看起来不少,但真正有用的信息并不多。
十三、低质量、重复和空页面为什么容易不索引?
文档里面专门提到了:
低质量、重复、空页面可能被发现但不索引。
这一点非常重要。
因为很多人看到:
“Google已经抓取了。”
就觉得页面一定应该收录。
其实并不是。
空页面
比如产品已经删除。
URL还返回200。
页面正文只有:
“No Product Found”
或者:
“Coming Soon”。
这种页面没有多少索引价值。
大量模板页面
例如100个产品。
正文全部是:
公司介绍;
相同FAQ;
相同优势;
相同参数说明。
只有:
型号名称
换了一下。
那么页面之间的独立性就很弱。
AI批量换关键词
例如:
Best Laser Machine in USA
Best Laser Machine in Canada
Best Laser Machine in Germany
正文几乎完全一样。
只替换:
国家名字。
这种页面批量做几百个,并不会因为 URL 多,就自动获得更多 SEO 价值。
标签页
比如标签页面里面只有:
一篇文章。
没有独立说明。
也没有真正导航价值。
这种页面有没有必要提交给 Google,本身就值得考虑。
站内搜索页面
例如:
/?s=laser
这种页面是给网站用户临时搜索的结果。
一般没有必要把大量搜索结果 URL 当成 SEO 页面提交。
SEO的目标不是:
让Google尽可能多收录URL。
而是:
让真正有价值的重要URL正常进入索引。
十四、检查Soft 404:页面是200,不代表页面真的正常
这是原文之外比较值得补充的一类。
有些页面服务器返回:
200。
看起来技术正常。
但是 Google 可能把它判断成:
Soft 404。
简单理解就是:
服务器告诉 Google:
“这个页面正常存在。”
但是 Google 看完内容觉得:
“这个页面实际上和不存在差不多。”
举个例子
URL:
example.com/product/laser-machine-a/
状态码:
200。
正文却只有:
“Product no longer available.”
然后整个页面没有其他有效内容。
这种页面就很容易出现 Soft 404 问题。
另外一种情况是正文加载失败
例如产品内容全部依赖接口。
普通浏览器偶尔能看到。
但是 Google 抓取时:
API失败;
JS没运行成功;
数据库报错。
最终 Google 实际看到的是一个空壳页面。
这种情况也要检查。
十五、内容是不是和其他页面太相似?
如果 Google 抓完一个页面以后发现:
网站里面已经有另外一个几乎相同的页面。
那就可能进入规范化处理。
Google会对重复或高度相似页面进行聚类,并选择一个代表版本作为 canonical;重复版本的抓取频率也可能更低。
产品网站特别容易出现
例如:
1000W Laser Cutting Machine
1500W Laser Cutting Machine
2000W Laser Cutting Machine
三个页面正文完全相同。
只改:
1000W;
1500W;
2000W。
这种时候需要考虑:
真的有必要分别做三个页面吗?
如果需要分别做。
那页面内容就应该体现真实差异。
例如:
适用材料;
切割厚度;
运行成本;
应用;
参数;
客户选择场景;
机器配置。
不是只换一个数字。
十六、不要什么关键词都单独建一个URL
收录问题有时候其实来自:
网站页面做得太碎。
比如发现这些关键词:
fiber laser cutter price
fiber laser cutting machine price
fiber laser machine cost
laser cutter cost
然后马上做4篇文章。
但实际 Google 搜索结果发现:
这些词的搜索意图非常接近。
这种情况下完全可以考虑:
一个完整页面覆盖。
而不是为了多做关键词,强行拆成4个很像的 URL。
页面拆得越碎。
越容易产生:
内容重复;
关键词蚕食;
薄页面;
索引压力。
所以页面发布以前,先做关键词分组其实也会影响后面的收录质量。
十七、检查页面是否真的被正常渲染
普通 WordPress 博客一般问题不大。
但是如果网站使用:
React;
Vue;
各种前端框架;
自定义产品系统;
大量AJAX;
JavaScript动态加载正文;
这一点值得检查。
Google抓取网页时会处理和渲染 JavaScript,但依赖 JavaScript 的站点仍然需要确保关键内容和索引信号能够被 Google 正确获取。
可以用GSC实时测试
进入:
URL Inspection
选择测试实时网址。
看看 Google 实际获取的内容是不是和自己浏览器看到的一样。
比如自己看到:
完整产品描述;
价格;
参数;
FAQ。
Google渲染出来却只有:
Header;
Footer;
Loading……
那问题就不是文章写得够不够长。
而是:
正文压根没有正常给 Google 看到。
十八、WordPress新站不收录,可以优先检查这些位置
如果使用 WordPress,可以快速检查几个常见地方。
1、设置 → 阅读
检查有没有开启:
建议搜索引擎不索引本站
测试站上线以后,这个地方经常被忘记。
2、Yoast SEO / Rank Math
检查:
文章;
页面;
产品;
产品分类;
文章分类
是不是误设 noindex。
3、Sitemap
确认重要 Content Type 有没有进入 Sitemap。
4、robots.txt
看看有没有屏蔽:
整站;
产品;
文章;
重要目录。
5、canonical
尤其是:
复制产品;
换域名;
测试站迁移;
多语言网站
以后。
6、缓存
有时候你明明已经取消 noindex。
但是:
LiteSpeed;
Cloudflare;
服务器页面缓存
仍然返回旧页面。
修改索引设置以后,可以检查缓存有没有更新。
7、安全插件
例如某些:
Firewall;
Bot Protection;
Cloudflare规则
可能误拦搜索引擎。
如果 GSC 出现:
403;
5xx;
抓取失败
就值得重点排查。
十九、Sitemap里有URL,但是没有内链入口,也是一个常见坑
文档里面这个点我建议新手特别注意。
很多人的思路是:
“只要进入 Sitemap,Google 就能看到,内链没关系。”
技术上 Sitemap 确实可以帮助发现 URL。
但是网站本身没有任何链接入口,会产生另外一个问题:
这个页面在网站里面到底处在什么位置?
例如一个重要产品页。
正常应该:
首页 → 产品 → 分类 → 产品
能够找到。
结果产品页面只存在 XML Sitemap。
普通用户根本没办法通过网站结构访问。
那网站架构本身就有问题。
所以:
Sitemap解决发现。
内链还承担网站结构和页面关系。
两者不是二选一。
二十、外链能不能帮助新站收录?
文档里面“未发现”阶段提到了:
Sitemap、内链、外链。
这个逻辑是对的。
外部网站链接到你的页面以后,也可能帮助 Google 发现 URL。
但这里不要理解成:
不收录 = 买外链。
如果页面本身是:
noindex;
canonical错误;
403;
服务器故障;
页面没有内容;
买外链也解决不了根本问题。
外链更适合做什么?
比如:
行业目录;
合作伙伴;
媒体报道;
真实引用;
品牌页面;
相关行业网站。
这些正常外部入口,对网站发现和整个站外信号都有意义。
新站不用为了“催收录”,突然买几百条垃圾链接。
先把:
技术;
页面;
内容;
内链
做好。
二十一、为什么每天重复提交URL通常没什么意义?
这个是文档列出的第一个常见坑。
新页面发布以后:
今天提交。
第二天没收录。
再提交。
第三天还是没收录。
继续提交。
一周点十几次。
其实如果页面存在真正的问题:
noindex;
canonical错;
内容重复;
服务器不稳定;
这种反复提交没有解决任何东西。
Google对于 “Crawled – currently not indexed” 的官方说明也明确写着,没有必要仅因为该状态重复重新提交 URL 进行抓取。
Request Indexing什么时候用?
我觉得可以用于:
重要新页面;
重要内容更新;
技术问题修复完成以后;
想让 Google 重新检查的重要 URL。
但是不要把它当成:
“SEO收录按钮。”
点击一次就应该收录。
不是这个逻辑。
二十二、页面还没有内容,就希望先收录,也没什么必要
有些网站开发的时候会先创建:
Products;
Solutions;
Applications;
Blog。
URL全部有了。
但是内容还没填。
然后就开始提交 Sitemap。
其实这个顺序没必要这么急。
比如页面现在只有:
标题;
一张占位图片;
Coming Soon;
一点模板文字。
就算 Google现在把 URL 抓走了,对 SEO 也没有太多帮助。
我个人更加建议:
重要页面基本完成以后,再让搜索引擎正常发现。
至少页面应该已经有:
明确主题;
正常正文;
基础图片;
内部链接;
Title;
H1;
用户需要的信息。
不要为了所谓:
“养URL”
把一堆空页面提前提交。
二十三、整站被robots.txt挡住,却一直改文章,是典型的方向错误
这个也是文档明确列出来的坑。
比如开发阶段:
User-agent: *
Disallow: /
一直没有取消。
网站运营人员不知道。
然后发现不收录以后开始:
增加文章字数;
修改关键词;
做外链;
调整Meta Description。
折腾一个月。
真正的问题却只是一条 robots 规则。
所以技术 SEO 的意义就在这里。
不是说每天研究特别复杂的抓取预算。
而是先保证这种基础错误不要发生。
二十四、标签页、搜索页等低价值页面,不要什么都提交
新手容易有一个想法:
收录1000页肯定比收录100页好。
实际上不一定。
例如1000个页面里面:
500个空标签;
200个站内搜索页面;
100个筛选参数;
100个几乎重复的分类。
真正的产品和内容只有100页。
这种“收录数量”没有太大意义。
可以问自己一个问题
这个页面如果出现在 Google 搜索结果里面:
真的能独立解决用户一个需求吗?
如果答案是:
不能。
只是一个系统自动生成的中间页面。
那有没有必要让它成为 SEO 页面,就值得重新考虑。
二十五、新站不收录,网站整体质量也要看
有时候你检查一个具体页面:
200正常;
robots正常;
没有noindex;
canonical正常;
内容也不是完全空。
但是网站还是有大量:
Crawled – currently not indexed。
这时候就不要只盯单页。
可以退回来看看整个网站。
网站是不是基本都是模板内容?
例如200个产品页:
公司优势一样;
FAQ一样;
介绍一样;
只有名称不同。
网站是不是主题非常混乱?
今天发:
机械;
明天发:
AI新闻;
后天发:
宠物;
只是因为这些词搜索量高。
网站是不是大量批量内容?
短时间新增几千个页面。
但真正有独立价值的内容很少。
重要页面是不是反而很弱?
Blog发了500篇。
但是:
产品分类;
产品详情;
解决方案
只有几句话。
如果是一个企业网站,这种资源分配本身就值得调整。
二十六、一个页面内容到底做到什么程度,才算比较完整?
这个没有统一字数。
不要理解成:
2000字就收录;
500字就不收录。
主要还是看搜索需求。
比如一个简单问题
“怎么查看网页字体?”
这个问题几步就能讲完。
没必要硬写5000字。
但是复杂产品页就不一样
比如:
Fiber Laser Cutting Machine
用户可能需要:
产品介绍;
型号;
参数;
功率;
材料;
切割厚度;
应用;
图片;
运行视频;
机器结构;
FAQ;
询价方式。
如果整个页面只有300字。
可能确实比较难把用户关心的信息完整讲清楚。
所以内容长度应该:
跟问题复杂程度走。
而不是统一追求字数。
二十七、可以给页面增加哪些真正有价值的内容?
如果发现页面已经抓取但一直不索引,可以从用户需求重新检查。
产品页可以增加
真实产品图片;
参数;
规格;
核心部件;
工作视频;
应用;
材料;
选型;
案例;
FAQ;
售后;
认证;
交期。
教程文章可以增加
实际步骤;
操作截图;
错误情况;
解决方法;
自己测试结果;
注意事项。
B2B解决方案可以增加
行业问题;
具体加工场景;
推荐产品;
参数;
案例;
不同方案区别;
客户常见问题。
重点不是:
为了“让 Google 收录”加字。
而是:
把这个页面本来应该解决的问题真正补完整。
二十八、新站多久没收录才算有问题?
这个没有统一答案。
不要看到别人说:
“我的文章两小时收录。”
就觉得自己的页面两天没收录一定异常。
不同网站:
抓取频率;
网站历史;
页面重要性;
内容;
服务器;
外部引用
都不一样。
与其看天数,不如看状态
如果:
Google根本没发现
就先解决发现问题。
如果:
已发现未抓取
就看抓取和网站整体情况。
如果:
已抓取未索引
就认真分析内容、重复和规范化。
如果:
明确被noindex、重定向或canonical排除
直接解决对应配置。
这种判断比:
“超过7天没收录怎么办?”
更有意义。
二十九、发现技术问题以后,不要当天改10遍
比如今天发现 canonical 有问题。
修改完成。
过两小时 GSC 还是老状态。
又改一遍。
晚上继续换插件。
第二天再换 URL。
这样反而容易把问题越搞越复杂。
Google重新抓取和重新评估需要时间。
特别是 canonical 问题,Google最新的官方排查文档也提醒,修复内容或规范化问题以后重新评估本身需要时间。
所以最好:
记录修改日期;
确认技术配置正确;
然后等待重新抓取。
不要今天:
canonical A。
明天:
canonical B。
后天:
又改回 A。
三十、新站不收录,我会按照这个顺序完整排查
如果现在给我一个:
“这个页面为什么不收录?”
我一般会先按下面顺序。
第一步:打开URL
确认用户自己能正常访问。
第二步:检查状态码
正常页面最好是:
200。
如果是:
404;
重定向;
403;
5xx
先解决对应问题。
第三步:打开GSC URL Inspection
看:
是否发现;
是否抓取;
索引状态;
最近抓取时间。
第四步:检查robots.txt
确保重要页面没有错误被屏蔽。
第五步:检查noindex
包括:
Meta Robots;
X-Robots-Tag;
WordPress插件设置。
第六步:检查canonical
看:
自己声明的;
Google选择的;
是不是同一个。
第七步:检查Sitemap
确认页面存在于正确 Sitemap。
第八步:检查内部链接
确认它不是孤儿页。
第九步:检查页面实际内容
是不是:
空;
薄;
重复;
模板化;
没有满足搜索需求。
第十步:检查Soft 404和渲染
Google真正看到的页面是不是完整的。
第十一步:检查网站整体
有没有:
大量垃圾URL;
标签;
参数;
重复页面;
批量AI薄内容。
第十二步:修改以后记录日期再观察
不要一小时刷新20次 GSC。
三十一、上线前可以用这份收录检查清单
GSC显示什么索引状态?
先知道问题属于:
未发现;
已发现未抓取;
已抓取未索引;
还是被排除。
URL是否返回200?
重要正常页面最好可以稳定返回:
200。
如果不是,就先判断原因。
robots和noindex是否正常?
robots不要错误挡抓取。
重要页面也不要存在 noindex。
canonical是否正确?
确认:
页面 canonical 没有错误指向其他 URL。
同时看 Google 实际选择哪个 canonical。
页面是否有正常内链?
不要让重要页面只有 Sitemap 能找到。
最好从:
分类;
导航;
相关文章;
相关产品
里面有正常入口。
内容是否足够独立和有用?
不要只问:
“这篇有多少字?”
更加应该问:
这个页面有没有独立解决一个真实问题?
和其他页面相比,有没有明显区别?
用户进来以后能不能真正得到需要的信息?
三十二、最后再区分一下四种情况怎么处理
为了后面自己排查方便,可以直接记下面这个逻辑。
未发现
问题重点:Google不知道这个URL。
检查:
Sitemap;
内链;
外链;
网站结构。
已发现未抓取
问题重点:Google知道,但还没真正访问。
检查:
服务器;
抓取情况;
大量低价值URL;
页面内部链接;
新站时间。
已抓取未索引
问题重点:Google已经看过,但是暂时没有放进索引。
检查:
内容质量;
页面独特性;
重复内容;
Soft 404;
canonical;
实际渲染;
网站整体质量。
被排除
问题重点:为什么这个URL被排除。
检查:
noindex;
canonical;
重复页面;
重定向;
404;
Soft 404;
robots;
服务器错误。
只要先把页面归到正确类别,后面排查一般就没有那么乱。
总结
新站上线以后不收录很常见。
但是不能把所有情况简单理解成:
“新站权重低,再等等就好了。”
有时候确实只是 Google 还没有来得及抓。
但也可能是:
robots.txt 错误;
页面 noindex;
canonical 指错;
URL在跳转;
服务器错误;
Sitemap没有页面;
没有内部链接;
页面内容太薄;
大量模板重复;
Soft 404;
JavaScript正文没有正常加载。
所以真正合理的排查顺序应该是:
第一步,看Google有没有发现URL。
如果没有:
检查 Sitemap、内链和其他发现入口。
第二步,看Google能不能正常抓取。
检查:
200状态;
robots;
服务器;
403;
5xx。
第三步,看页面是否允许索引。
检查:
noindex;
X-Robots-Tag。
第四步,看canonical有没有问题。
确认 Google 是否把其他 URL 当成规范页面。
第五步,看页面是不是正常完整页面。
检查:
Soft 404;
渲染;
空内容。
第六步,再看内容质量。
检查:
内容是不是太薄;
是不是和其他页面重复;
是不是大量模板;
是不是有真正独立价值。
第七步,看网站整体结构。
重要页面有没有内链;
有没有大量标签页、搜索页和参数 URL;
网站主题是否清楚。
特别要分清:
Discovered – currently not indexed
代表:
Google已经发现URL,但还没有抓取。
而:
Crawled – currently not indexed
代表:
Google已经抓取页面,但目前没有进入索引。
这两个状态虽然看起来只差一个词,实际排查方向完全不同。
另外不要把:
Sitemap成功;
Request Indexing成功;
页面返回200
理解成:
Google就必须收录。
Google官方关于搜索工作方式的文档也明确说明,网页经过抓取以后,索引并不是必然发生的。
所以新站真正应该追求的,不是:
“怎么让Google把我所有URL都收录?”
而应该是:
让真正重要的页面容易被发现、能够正常抓取、允许索引、规范化正确,并且本身值得进入搜索结果。
如果这些基础都做好了,再观察 Google Search Console 的变化。
比每天重复提交几十次 URL,更有意义。

乐予博客

