人间
总有一两风

新站为什么不收录:从发现、抓取到内容质量逐项排查

新网站上线以后,经常会碰到一个比较头疼的问题:

页面一直不收录。

网站已经做好了。

Google Search Console 也添加了。

Sitemap 提交了。

文章也更新了一些。

但是过了几天甚至几周,搜索自己的页面还是看不到。

然后就开始每天:

提交 URL;

重新提交 Sitemap;

修改文章;

改 Title;

找外链;

甚至怀疑是不是域名有问题。

其实新站不收录,并不是只有一个原因。

有的网站是:

Google 根本还没有发现这个 URL。

有的是:

URL 已经发现了,但是还没有抓取。

还有的是:

Google 已经抓过页面,但是暂时没有放进索引。

也有一些比较直接的技术问题,比如:

robots.txt 把页面挡住了;

页面存在 noindex;

canonical 指向其他页面;

页面一直跳转;

服务器返回错误;

页面实际上是空的。

所以排查收录问题的时候,我个人不太建议一上来就研究:

“怎么样让 Google 秒收?”

先把流程搞清楚。

一个页面正常进入 Google,大概会经历:

发现 URL → 抓取页面 → 处理页面 → 判断规范版本 → 判断是否进入索引

所以新站不收录,也应该按照这个顺序查。

先看:

Google知不知道这个页面。

然后看:

Google能不能正常访问。

最后再看:

Google抓完以后,为什么没有选择索引。

这样排查会清楚很多。


一、先搞懂:不收录和没排名不是同一个问题

这个问题新手经常混在一起。

比如网站做的是:

fiber laser cutting machine

然后去 Google 搜这个关键词。

翻了十几页都没有找到自己的网站。

于是觉得:

“我的产品页面没有收录。”

其实不一定。

有可能页面已经进入 Google 索引,只是这个关键词暂时没有排名,或者排名比较靠后。

所以判断一个具体 URL 有没有进入 Google,我一般不会只搜索目标关键词。

最直接的方法还是看GSC网址检查

进入:

Google Search Console → 网址检查 / URL Inspection

输入具体 URL。

例如:

https://example.com/fiber-laser-cutting-machine

然后看 Google 给出的状态。

这里通常比自己不停使用:

site:example.com

更加适合排查单个页面。

Google Search Console 的 Page Indexing 报告会区分不同未索引原因,例如 Crawled – currently not indexed、Discovered – currently not indexed、noindex、重定向以及服务器错误等。

页面被索引,也不代表一定有排名

这个区别一定要先搞明白:

索引解决的是:Google有没有把这个页面放进自己的索引系统。

排名解决的是:用户搜索某个关键词时,这个页面排在哪里。

一个页面完全可以:

已经索引;

但是没有核心词排名。

也可能:

核心词没有排名;

却已经有很多长尾词曝光。

所以真正排查“新站为什么不收录”,第一步先确定:

它到底是真的没索引,还是只是暂时没排名。


二、为什么新站特别容易出现收录慢?

新站上线后出现部分页面没有马上进入索引,其实并不奇怪。

因为对 Google 来说,这个网站很多东西都是新的。

比如:

新域名;

新网站;

新页面;

新网站结构;

新的内部链接关系;

新的内容主题。

而且很多新站刚上线的时候,还有一个共同特点:

外部链接比较少。

Google 可以通过很多方式发现页面,比如 Sitemap、网站内部链接以及外部链接。

老网站可能已经有:

大量页面;

很多历史链接;

经常被 Googlebot 访问;

外部网站不断引用。

新网站往往没有这些基础。

所以 Google 发现和重新访问新页面的速度可能就没有成熟网站那么快。

新站外链少,发现页面可能比较慢

这里不是说:

新站不收录就必须马上买外链。

而是要理解:

外部链接本身也是搜索引擎发现页面的一种入口。

如果新网站完全没有任何外部引用,那么更应该先把:

Sitemap;

网站导航;

分类;

内部链接

做好。

至少保证 Google 从已经知道的页面里面,能够继续找到其他重要页面。

没有内链的页面更容易被忽略

比如网站有一篇文章:

example.com/laser-cutting-machine-price/

这个页面:

Sitemap 里面有;

你自己知道 URL;

但是网站首页没有;

Blog 列表没有;

分类页面没有;

旧文章也没有任何链接过去。

这种页面就是比较典型的:

孤儿页面。

Google可能通过 Sitemap 知道它存在。

但是从网站结构来看,这个页面并没有得到多少内部支持。

所以新站做内容的时候,不要只负责:

“发布页面。”

还应该考虑:

发布以后谁链接它?


三、第一步:先用GSC网址检查,看页面到底卡在哪里

排查的时候,我个人比较建议先不要改任何东西。

先把 URL 放到 GSC 的网址检查工具里面。

因为不同状态对应的处理方法不一样。

如果连状态都没看,就直接:

改 Title;

提交 Sitemap;

增加外链;

很容易做错方向。

可以重点看几个地方

URL是否在Google上

先判断页面是不是已经进入索引。

如果已经在 Google 上,就不属于单纯的“不收录”问题。

Google有没有抓取过

看看:

Last crawl。

如果连抓取日期都没有,需要先看发现和抓取。

是否允许索引

看:

Indexing allowed?

如果这里因为 noindex 显示不允许索引,就先去解决 noindex。

用户声明的canonical是什么

也就是:

User-declared canonical。

Google选择的canonical是什么

也就是:

Google-selected canonical。

如果自己希望收录 A 页面。

Google最后却选择 B 页面作为 canonical,那就要检查规范化问题。

不同状态不要使用同一种解决办法

例如:

Discovered – currently not indexed

和:

Crawled – currently not indexed

虽然中文看起来都属于:

“尚未编入索引。”

但是实际完全不是一个阶段。

前者 Google 还没有真正抓取页面。

后者 Google 已经抓取过页面,只是目前没有放入索引。

Google 官方目前也是这样分别定义这两个状态。

所以后面我们分开讲。


四、第二步:确认URL是不是正常返回200

如果一个页面希望 Google 正常索引,首先它应该是一个真正可以访问的正常页面。

最基础的就是检查:

HTTP状态码。

普通正常页面一般应该返回:

200 OK

如果返回其他状态,就需要先判断这个状态是不是符合自己的预期。

404

404 表示页面不存在。

例如你自己访问:

example.com/product-a/

看起来页面已经删掉了。

服务器也返回404。

那 Google 正常情况下当然不会把这个 URL 当作普通有效内容长期索引。

如果页面本来就不存在,404没什么奇怪。

问题是:

这个页面本来应该存在,却错误返回了404。

这种就要先修页面。

301或302

如果 URL 本身已经跳转到另外一个页面。

例如:

A → 301 → B

那 Google 更可能处理的是:

B 页面。

所以看到:

Page with redirect

不要一直要求 Google 收录原来的 A。

先确认这个跳转本身是不是自己想要的。

403

403一般表示:

服务器拒绝访问。

有时候自己浏览器访问没有问题,但是:

Cloudflare;

服务器防火墙;

安全插件;

Bot Protection

可能对 Googlebot 产生错误限制。

Google Search Console 对 403 的说明也很直接:如果 Googlebot 被拒绝访问,该页面无法正常被索引。

5xx

例如:

500;

502;

503。

这些属于服务器端错误。

如果 Google 来抓页面的时候,经常碰到服务器报错,自然会影响正常抓取。

这个时候应该先解决:

服务器;

PHP;

数据库;

CDN;

缓存;

程序错误。

而不是继续写更多文章。

新站最好检查几个重要页面

比如:

首页;

产品分类;

主要产品;

Blog;

核心文章。

确认这些页面:

正常打开;

没有跳转错误;

没有服务器错误;

返回200。

基础先稳定下来。


五、第三步:检查robots.txt有没有把Google挡住

robots.txt 是新站收录里面比较常见的技术问题。

尤其是:

开发站;

测试站;

网站改版以后正式上线。

开发的时候为了避免搜索引擎抓测试内容,经常会设置比较严格的 robots 规则。

正式上线以后如果忘记改回来,就可能出现:

网站什么都做好了;

Google却根本没办法正常抓取重要目录。

一个特别明显的错误

比如:

User-agent: *
Disallow: /

这个规则基本就是告诉爬虫:

整个网站都不要抓。

如果正式网站还留着这种配置,那就要处理。

robots.txt主要控制的是抓取

这里很容易理解错。

robots.txt 主要是在告诉搜索引擎:

哪些URL可以请求,哪些URL不要请求。

它不是专门用来控制普通网页“是否进入索引”的工具。

Google 官方也明确区分了 robots.txt 和 noindex:robots.txt 用于控制抓取;如果明确不希望网页进入 Google Search,更适合使用 noindex 等索引控制方式。

不要随便复制别人的robots.txt

网上经常能看到:

“WordPress最佳robots.txt模板。”

复制进去以后有几十条规则。

但是自己根本不知道每一条是什么意思。

其实普通企业站或者小型 WordPress 网站没有必要一开始就配置得特别复杂。

最重要的是:

不要错误屏蔽自己真正需要收录的页面。

例如:

Products;

Blog;

分类页;

重要图片资源。


六、第四步:检查页面有没有noindex

如果 robots.txt 没问题,下一步重点检查:

noindex。

这个问题很直接。

页面可以访问。

Google也能够抓取。

但是 HTML 里面告诉 Google:

不要索引这个页面。

那页面自然不会进入正常索引。

Google 官方说明,noindex 可以通过 robots meta tag 或 HTTP response header 设置;当 Googlebot 抓取页面并读取到该规则后,页面会被排除出 Google Search。

WordPress特别容易在哪里出现?

设置 → 阅读

WordPress 后台有一个类似:

建议搜索引擎不索引本站

的设置。

测试网站的时候经常会勾。

网站正式上线后一定检查有没有取消。

SEO插件

例如:

Yoast SEO;

Rank Math。

这些插件都可以针对:

文章;

页面;

分类;

标签;

产品;

产品分类

设置索引规则。

有时候只是某一种 Content Type 被整体设置成了 noindex。

还有X-Robots-Tag

有些 noindex 并不是写在 HTML <meta> 里面。

而是在服务器返回的 HTTP Header:

X-Robots-Tag

里面设置。

所以如果源码里面明明没看到 noindex,但是 GSC 还是提示被 noindex 排除,可以继续查响应头。

一个容易搞反的地方

如果页面被 robots.txt 完全禁止抓取,Googlebot可能根本看不到页面里面的 noindex。

所以不要使用:

robots.txt禁止抓取 + 希望Google读取noindex

这种互相打架的做法。

Google 官方也特别提醒:noindex 要生效,Googlebot必须能够访问页面并读取该规则。


七、第五步:检查canonical是不是指错页面

canonical 也是导致:

“这个 URL 为什么不收录?”

非常常见的原因。

例如页面:

example.com/product-a/

但是代码里面写:

<link rel="canonical" href="https://example.com/product-b/">

那实际上是在给 Google 一个很明显的信号:

B更适合作为这组相似页面的规范版本。

为什么会出现canonical错误?

常见情况有:

WordPress SEO插件设置错误;

测试域名没有换干净;

HTTP和HTTPS混乱;

www和非www混乱;

参数URL;

产品筛选;

多语言插件配置;

模板把canonical写死;

复制页面以后忘记修改。

在GSC重点看两个地方

User-declared canonical

自己声明的是谁。

Google-selected canonical

Google最后选择的是谁。

如果两者完全一致,而且就是当前页面,基本比较正常。

如果自己声明 A。

Google长期选择 B。

就需要继续看:

A和B是不是太像;

内部链接主要指向哪个;

Sitemap里面提交哪个;

有没有重定向;

不同页面内容到底有没有明显区别。

canonical不是绝对命令

这一点也要注意。

你写 canonical,不代表 Google 100%必须按照这个选择。

Google会综合不同规范化信号选择代表 URL;官方目前把重定向和 rel="canonical" 视为较强信号,而 Sitemap 属于较弱的 canonical 信号。

所以如果 Google 经常忽略你设置的 canonical,不要只把标签再写一遍。

应该找:

为什么它会觉得另外一个 URL 更像真正的主版本。


八、第六步:提交Sitemap,但不要把Sitemap当成“强制收录工具”

新网站一般建议有 XML Sitemap。

例如 WordPress 常见:

/sitemap_index.xml

或者:

/wp-sitemap.xml

然后提交到:

Google Search Console。

Sitemap主要解决的是发现问题

Sitemap 可以帮助 Google 了解:

网站有哪些重要 URL;

哪些页面是新页面;

哪些发生了更新。

它是一个非常有用的发现入口。

但是这里要注意:

Sitemap成功 ≠ 页面一定收录。

Google仍然会自己进行:

抓取;

规范化;

索引判断。

所以 Search Console 显示 Sitemap:

Success

以后,不要理解成:

“里面500个 URL 理论上都应该收录。”

Sitemap里面最好只放真正希望索引的URL

比如网站里面有:

产品;

文章;

重要分类。

这些可以放。

但是一些低价值页面,比如:

站内搜索结果;

无内容标签;

某些参数页;

测试页面;

重复模板页

本身不准备做搜索流量,就没有必要全部往 Sitemap 里面塞。

Sitemap和canonical最好统一

例如:

Sitemap里面提交 A。

页面 canonical 却指向 B。

这种信号本身就是矛盾的。

Google官方也建议 Sitemap 中包含你希望作为 canonical 的 URL。


九、第七步:确认页面真的有内部链接入口

文档里面这一点很重要,我觉得值得单独讲。

很多网站会出现:

Sitemap有这个URL,但是网站里面根本找不到它。

例如一篇文章发布以后:

没有放入正常分类;

首页没有入口;

文章列表没有;

旧文章没有链接;

相关文章没有;

导航更没有。

只有你自己拿着 URL 才能访问。

这样的页面就是比较典型的孤儿页。

Sitemap不能完全代替内链结构

Sitemap告诉 Google:

“我有这个页面。”

内部链接则同时告诉搜索引擎和用户:

“这个页面和网站里的其他内容有什么关系。”

比如:

首页

产品中心

激光切割机

Fiber Laser Cutting Machine

这种关系比较清楚。

或者:

SEO教程

技术SEO

Google收录

新站不收录排查

这样页面的主题归属比较容易理解。

新文章发布以后,可以顺手做几个内链

比如你刚写:

《新站为什么不收录》

网站已有:

Google Search Console教程;

robots.txt教程;

Sitemap教程;

canonical教程;

SEO新手学习顺序。

这些地方提到收录问题时,就可以链接到新文章。

新文章里面同样可以再链接出去。

这样整个网站不是一篇篇孤立内容,而是慢慢连起来。


十、四种情况要分开:未发现、已发现未抓取、已抓取未索引、被排除

文档里面把不收录问题分成四类,这个分类非常适合新手排查。

不要看到所有“未索引”,都用同一个处理方式。

第一种:Google还没有发现URL

这种情况下重点不是内容质量。

因为 Google 可能还不知道页面存在。

主要检查:

Sitemap;

内部链接;

网站导航;

分类结构;

外部链接。

第二种:已经发现,但是还没有抓取

常见状态:

Discovered – currently not indexed

Google已经知道 URL 存在,但是目前还没有真正抓取。

Google官方目前的解释是:页面已被发现但尚未抓取,通常 Google 原本准备抓取,但预计这可能对网站造成较大抓取负载,因此重新安排抓取时间。

这时候可以继续看:

服务器是不是很慢;

网站是不是大量产生URL;

重要页面内链是不是太弱;

Google是不是把大量抓取资源浪费在参数、筛选、标签等低价值URL上。

如果新网站只有少量页面出现这个状态,也不要当天就判断成严重故障。

第三种:已经抓取,但是没有索引

常见状态:

Crawled – currently not indexed

这个状态要换一个思路。

因为 Google 已经访问过页面。

技术上至少说明:

它曾经能够抓到页面。

Google官方对该状态的描述是:页面已经被抓取,但目前没有进入索引,未来可能会也可能不会进入索引,并不需要因为这个状态不断重复提交抓取。

这时候更应该重点检查:

页面质量;

内容是不是太薄;

是不是重复;

是不是模板页;

canonical;

Soft 404;

页面实际渲染内容。

第四种:页面被排除

这种一般需要看具体排除原因。

比如:

noindex;

canonical;

重复页;

重定向;

404;

Soft 404;

服务器错误;

robots限制。

很多“被排除”其实是正常现象。

例如:

A页面301到B页面。

那A显示:

Page with redirect

本来就是预期结果。

不要看到“Excluded”几个字,就认为必须全部修成Indexed。


十一、已发现但未抓取:重点排查什么?

如果大量重要页面长期停留在:

Discovered – currently not indexed

可以重点看下面几个方面。

1、服务器性能

打开网站是不是经常很慢?

有没有:

超时;

5xx;

数据库错误;

CDN不稳定。

如果服务器本身状态很差,就先把网站稳定下来。

2、网站是不是产生了大量垃圾URL

WordPress和WooCommerce很容易产生:

标签;

分页;

搜索结果;

筛选;

参数;

产品属性;

各种Feed。

例如网站真正有用页面只有500个。

搜索引擎却发现50000个 URL。

自然会增加网站抓取和管理复杂度。

3、重要页面内链是不是太弱

如果页面只有 Sitemap 入口,没有正常内链,可以加强相关页面之间的连接。

4、新站是不是一次发布太多页面

网站刚上线。

第一天发1000篇 AI 内容。

每篇只是:

关键词不同;

正文结构一样。

这种做法很容易让整个网站变得特别臃肿。

与其天天研究怎么让这1000个URL全部收录,不如先问:

这些 URL 真的都有单独存在的价值吗?


十二、已经抓取但不索引:开始重点看内容质量

如果页面是:

Crawled – currently not indexed

而且:

返回200;

robots允许;

没有noindex;

canonical基本正常;

那我觉得就不要一直在技术设置里面来回转了。

应该认真看页面本身。

Google官方关于搜索工作原理的文档明确说明,索引并不是保证发生的;页面抓取完成后仍然要经过内容和规范化等处理,低质量内容、索引规则以及网站设计问题都可能影响索引。

页面是不是太空?

例如一个机械产品页面只有:

产品名称;

一张图片;

一句公司介绍;

Contact Us按钮。

虽然 URL 正常存在。

但是对搜索用户来说,能获取的信息非常少。

如果目标关键词本身竞争比较强,这种页面自然很弱。

用户真正需要的信息有没有?

比如 Fiber Laser Cutting Machine 产品页。

用户可能关心:

机器有哪些功率;

可以切什么材料;

切多厚;

技术参数;

机器尺寸;

激光器品牌;

核心部件;

应用场景;

运行视频;

售后;

交期;

选型方式。

页面连这些基础内容都没有。

却写了1000字:

“Our company is a professional manufacturer……”

这种内容数量看起来不少,但真正有用的信息并不多。


十三、低质量、重复和空页面为什么容易不索引?

文档里面专门提到了:

低质量、重复、空页面可能被发现但不索引。

这一点非常重要。

因为很多人看到:

“Google已经抓取了。”

就觉得页面一定应该收录。

其实并不是。

空页面

比如产品已经删除。

URL还返回200。

页面正文只有:

“No Product Found”

或者:

“Coming Soon”。

这种页面没有多少索引价值。

大量模板页面

例如100个产品。

正文全部是:

公司介绍;

相同FAQ;

相同优势;

相同参数说明。

只有:

型号名称

换了一下。

那么页面之间的独立性就很弱。

AI批量换关键词

例如:

Best Laser Machine in USA

Best Laser Machine in Canada

Best Laser Machine in Germany

正文几乎完全一样。

只替换:

国家名字。

这种页面批量做几百个,并不会因为 URL 多,就自动获得更多 SEO 价值。

标签页

比如标签页面里面只有:

一篇文章。

没有独立说明。

也没有真正导航价值。

这种页面有没有必要提交给 Google,本身就值得考虑。

站内搜索页面

例如:

/?s=laser

这种页面是给网站用户临时搜索的结果。

一般没有必要把大量搜索结果 URL 当成 SEO 页面提交。

SEO的目标不是:

让Google尽可能多收录URL。

而是:

让真正有价值的重要URL正常进入索引。


十四、检查Soft 404:页面是200,不代表页面真的正常

这是原文之外比较值得补充的一类。

有些页面服务器返回:

200。

看起来技术正常。

但是 Google 可能把它判断成:

Soft 404。

简单理解就是:

服务器告诉 Google:

“这个页面正常存在。”

但是 Google 看完内容觉得:

“这个页面实际上和不存在差不多。”

举个例子

URL:

example.com/product/laser-machine-a/

状态码:

200。

正文却只有:

“Product no longer available.”

然后整个页面没有其他有效内容。

这种页面就很容易出现 Soft 404 问题。

另外一种情况是正文加载失败

例如产品内容全部依赖接口。

普通浏览器偶尔能看到。

但是 Google 抓取时:

API失败;

JS没运行成功;

数据库报错。

最终 Google 实际看到的是一个空壳页面。

这种情况也要检查。


十五、内容是不是和其他页面太相似?

如果 Google 抓完一个页面以后发现:

网站里面已经有另外一个几乎相同的页面。

那就可能进入规范化处理。

Google会对重复或高度相似页面进行聚类,并选择一个代表版本作为 canonical;重复版本的抓取频率也可能更低。

产品网站特别容易出现

例如:

1000W Laser Cutting Machine

1500W Laser Cutting Machine

2000W Laser Cutting Machine

三个页面正文完全相同。

只改:

1000W;

1500W;

2000W。

这种时候需要考虑:

真的有必要分别做三个页面吗?

如果需要分别做。

那页面内容就应该体现真实差异。

例如:

适用材料;

切割厚度;

运行成本;

应用;

参数;

客户选择场景;

机器配置。

不是只换一个数字。


十六、不要什么关键词都单独建一个URL

收录问题有时候其实来自:

网站页面做得太碎。

比如发现这些关键词:

fiber laser cutter price

fiber laser cutting machine price

fiber laser machine cost

laser cutter cost

然后马上做4篇文章。

但实际 Google 搜索结果发现:

这些词的搜索意图非常接近。

这种情况下完全可以考虑:

一个完整页面覆盖。

而不是为了多做关键词,强行拆成4个很像的 URL。

页面拆得越碎。

越容易产生:

内容重复;

关键词蚕食;

薄页面;

索引压力。

所以页面发布以前,先做关键词分组其实也会影响后面的收录质量。


十七、检查页面是否真的被正常渲染

普通 WordPress 博客一般问题不大。

但是如果网站使用:

React;

Vue;

各种前端框架;

自定义产品系统;

大量AJAX;

JavaScript动态加载正文;

这一点值得检查。

Google抓取网页时会处理和渲染 JavaScript,但依赖 JavaScript 的站点仍然需要确保关键内容和索引信号能够被 Google 正确获取。

可以用GSC实时测试

进入:

URL Inspection

选择测试实时网址。

看看 Google 实际获取的内容是不是和自己浏览器看到的一样。

比如自己看到:

完整产品描述;

价格;

参数;

FAQ。

Google渲染出来却只有:

Header;

Footer;

Loading……

那问题就不是文章写得够不够长。

而是:

正文压根没有正常给 Google 看到。


十八、WordPress新站不收录,可以优先检查这些位置

如果使用 WordPress,可以快速检查几个常见地方。

1、设置 → 阅读

检查有没有开启:

建议搜索引擎不索引本站

测试站上线以后,这个地方经常被忘记。

2、Yoast SEO / Rank Math

检查:

文章;

页面;

产品;

产品分类;

文章分类

是不是误设 noindex。

3、Sitemap

确认重要 Content Type 有没有进入 Sitemap。

4、robots.txt

看看有没有屏蔽:

整站;

产品;

文章;

重要目录。

5、canonical

尤其是:

复制产品;

换域名;

测试站迁移;

多语言网站

以后。

6、缓存

有时候你明明已经取消 noindex。

但是:

LiteSpeed;

Cloudflare;

服务器页面缓存

仍然返回旧页面。

修改索引设置以后,可以检查缓存有没有更新。

7、安全插件

例如某些:

Firewall;

Bot Protection;

Cloudflare规则

可能误拦搜索引擎。

如果 GSC 出现:

403;

5xx;

抓取失败

就值得重点排查。


十九、Sitemap里有URL,但是没有内链入口,也是一个常见坑

文档里面这个点我建议新手特别注意。

很多人的思路是:

“只要进入 Sitemap,Google 就能看到,内链没关系。”

技术上 Sitemap 确实可以帮助发现 URL。

但是网站本身没有任何链接入口,会产生另外一个问题:

这个页面在网站里面到底处在什么位置?

例如一个重要产品页。

正常应该:

首页 → 产品 → 分类 → 产品

能够找到。

结果产品页面只存在 XML Sitemap。

普通用户根本没办法通过网站结构访问。

那网站架构本身就有问题。

所以:

Sitemap解决发现。

内链还承担网站结构和页面关系。

两者不是二选一。


二十、外链能不能帮助新站收录?

文档里面“未发现”阶段提到了:

Sitemap、内链、外链。

这个逻辑是对的。

外部网站链接到你的页面以后,也可能帮助 Google 发现 URL。

但这里不要理解成:

不收录 = 买外链。

如果页面本身是:

noindex;

canonical错误;

403;

服务器故障;

页面没有内容;

买外链也解决不了根本问题。

外链更适合做什么?

比如:

行业目录;

合作伙伴;

媒体报道;

真实引用;

品牌页面;

相关行业网站。

这些正常外部入口,对网站发现和整个站外信号都有意义。

新站不用为了“催收录”,突然买几百条垃圾链接。

先把:

技术;

页面;

内容;

内链

做好。


二十一、为什么每天重复提交URL通常没什么意义?

这个是文档列出的第一个常见坑。

新页面发布以后:

今天提交。

第二天没收录。

再提交。

第三天还是没收录。

继续提交。

一周点十几次。

其实如果页面存在真正的问题:

noindex;

canonical错;

内容重复;

服务器不稳定;

这种反复提交没有解决任何东西。

Google对于 “Crawled – currently not indexed” 的官方说明也明确写着,没有必要仅因为该状态重复重新提交 URL 进行抓取。

Request Indexing什么时候用?

我觉得可以用于:

重要新页面;

重要内容更新;

技术问题修复完成以后;

想让 Google 重新检查的重要 URL。

但是不要把它当成:

“SEO收录按钮。”

点击一次就应该收录。

不是这个逻辑。


二十二、页面还没有内容,就希望先收录,也没什么必要

有些网站开发的时候会先创建:

Products;

Solutions;

Applications;

Blog。

URL全部有了。

但是内容还没填。

然后就开始提交 Sitemap。

其实这个顺序没必要这么急。

比如页面现在只有:

标题;

一张占位图片;

Coming Soon;

一点模板文字。

就算 Google现在把 URL 抓走了,对 SEO 也没有太多帮助。

我个人更加建议:

重要页面基本完成以后,再让搜索引擎正常发现。

至少页面应该已经有:

明确主题;

正常正文;

基础图片;

内部链接;

Title;

H1;

用户需要的信息。

不要为了所谓:

“养URL”

把一堆空页面提前提交。


二十三、整站被robots.txt挡住,却一直改文章,是典型的方向错误

这个也是文档明确列出来的坑。

比如开发阶段:

User-agent: *
Disallow: /

一直没有取消。

网站运营人员不知道。

然后发现不收录以后开始:

增加文章字数;

修改关键词;

做外链;

调整Meta Description。

折腾一个月。

真正的问题却只是一条 robots 规则。

所以技术 SEO 的意义就在这里。

不是说每天研究特别复杂的抓取预算。

而是先保证这种基础错误不要发生。


二十四、标签页、搜索页等低价值页面,不要什么都提交

新手容易有一个想法:

收录1000页肯定比收录100页好。

实际上不一定。

例如1000个页面里面:

500个空标签;

200个站内搜索页面;

100个筛选参数;

100个几乎重复的分类。

真正的产品和内容只有100页。

这种“收录数量”没有太大意义。

可以问自己一个问题

这个页面如果出现在 Google 搜索结果里面:

真的能独立解决用户一个需求吗?

如果答案是:

不能。

只是一个系统自动生成的中间页面。

那有没有必要让它成为 SEO 页面,就值得重新考虑。


二十五、新站不收录,网站整体质量也要看

有时候你检查一个具体页面:

200正常;

robots正常;

没有noindex;

canonical正常;

内容也不是完全空。

但是网站还是有大量:

Crawled – currently not indexed。

这时候就不要只盯单页。

可以退回来看看整个网站。

网站是不是基本都是模板内容?

例如200个产品页:

公司优势一样;

FAQ一样;

介绍一样;

只有名称不同。

网站是不是主题非常混乱?

今天发:

机械;

明天发:

AI新闻;

后天发:

宠物;

只是因为这些词搜索量高。

网站是不是大量批量内容?

短时间新增几千个页面。

但真正有独立价值的内容很少。

重要页面是不是反而很弱?

Blog发了500篇。

但是:

产品分类;

产品详情;

解决方案

只有几句话。

如果是一个企业网站,这种资源分配本身就值得调整。


二十六、一个页面内容到底做到什么程度,才算比较完整?

这个没有统一字数。

不要理解成:

2000字就收录;

500字就不收录。

主要还是看搜索需求。

比如一个简单问题

“怎么查看网页字体?”

这个问题几步就能讲完。

没必要硬写5000字。

但是复杂产品页就不一样

比如:

Fiber Laser Cutting Machine

用户可能需要:

产品介绍;

型号;

参数;

功率;

材料;

切割厚度;

应用;

图片;

运行视频;

机器结构;

FAQ;

询价方式。

如果整个页面只有300字。

可能确实比较难把用户关心的信息完整讲清楚。

所以内容长度应该:

跟问题复杂程度走。

而不是统一追求字数。


二十七、可以给页面增加哪些真正有价值的内容?

如果发现页面已经抓取但一直不索引,可以从用户需求重新检查。

产品页可以增加

真实产品图片;

参数;

规格;

核心部件;

工作视频;

应用;

材料;

选型;

案例;

FAQ;

售后;

认证;

交期。

教程文章可以增加

实际步骤;

操作截图;

错误情况;

解决方法;

自己测试结果;

注意事项。

B2B解决方案可以增加

行业问题;

具体加工场景;

推荐产品;

参数;

案例;

不同方案区别;

客户常见问题。

重点不是:

为了“让 Google 收录”加字。

而是:

把这个页面本来应该解决的问题真正补完整。


二十八、新站多久没收录才算有问题?

这个没有统一答案。

不要看到别人说:

“我的文章两小时收录。”

就觉得自己的页面两天没收录一定异常。

不同网站:

抓取频率;

网站历史;

页面重要性;

内容;

服务器;

外部引用

都不一样。

与其看天数,不如看状态

如果:

Google根本没发现

就先解决发现问题。

如果:

已发现未抓取

就看抓取和网站整体情况。

如果:

已抓取未索引

就认真分析内容、重复和规范化。

如果:

明确被noindex、重定向或canonical排除

直接解决对应配置。

这种判断比:

“超过7天没收录怎么办?”

更有意义。


二十九、发现技术问题以后,不要当天改10遍

比如今天发现 canonical 有问题。

修改完成。

过两小时 GSC 还是老状态。

又改一遍。

晚上继续换插件。

第二天再换 URL。

这样反而容易把问题越搞越复杂。

Google重新抓取和重新评估需要时间。

特别是 canonical 问题,Google最新的官方排查文档也提醒,修复内容或规范化问题以后重新评估本身需要时间。

所以最好:

记录修改日期;

确认技术配置正确;

然后等待重新抓取。

不要今天:

canonical A。

明天:

canonical B。

后天:

又改回 A。


三十、新站不收录,我会按照这个顺序完整排查

如果现在给我一个:

“这个页面为什么不收录?”

我一般会先按下面顺序。

第一步:打开URL

确认用户自己能正常访问。

第二步:检查状态码

正常页面最好是:

200。

如果是:

404;

重定向;

403;

5xx

先解决对应问题。

第三步:打开GSC URL Inspection

看:

是否发现;

是否抓取;

索引状态;

最近抓取时间。

第四步:检查robots.txt

确保重要页面没有错误被屏蔽。

第五步:检查noindex

包括:

Meta Robots;

X-Robots-Tag;

WordPress插件设置。

第六步:检查canonical

看:

自己声明的;

Google选择的;

是不是同一个。

第七步:检查Sitemap

确认页面存在于正确 Sitemap。

第八步:检查内部链接

确认它不是孤儿页。

第九步:检查页面实际内容

是不是:

空;

薄;

重复;

模板化;

没有满足搜索需求。

第十步:检查Soft 404和渲染

Google真正看到的页面是不是完整的。

第十一步:检查网站整体

有没有:

大量垃圾URL;

标签;

参数;

重复页面;

批量AI薄内容。

第十二步:修改以后记录日期再观察

不要一小时刷新20次 GSC。


三十一、上线前可以用这份收录检查清单

GSC显示什么索引状态?

先知道问题属于:

未发现;

已发现未抓取;

已抓取未索引;

还是被排除。

URL是否返回200?

重要正常页面最好可以稳定返回:

200。

如果不是,就先判断原因。

robots和noindex是否正常?

robots不要错误挡抓取。

重要页面也不要存在 noindex。

canonical是否正确?

确认:

页面 canonical 没有错误指向其他 URL。

同时看 Google 实际选择哪个 canonical。

页面是否有正常内链?

不要让重要页面只有 Sitemap 能找到。

最好从:

分类;

导航;

相关文章;

相关产品

里面有正常入口。

内容是否足够独立和有用?

不要只问:

“这篇有多少字?”

更加应该问:

这个页面有没有独立解决一个真实问题?

和其他页面相比,有没有明显区别?

用户进来以后能不能真正得到需要的信息?


三十二、最后再区分一下四种情况怎么处理

为了后面自己排查方便,可以直接记下面这个逻辑。

未发现

问题重点:Google不知道这个URL。

检查:

Sitemap;

内链;

外链;

网站结构。

已发现未抓取

问题重点:Google知道,但还没真正访问。

检查:

服务器;

抓取情况;

大量低价值URL;

页面内部链接;

新站时间。

已抓取未索引

问题重点:Google已经看过,但是暂时没有放进索引。

检查:

内容质量;

页面独特性;

重复内容;

Soft 404;

canonical;

实际渲染;

网站整体质量。

被排除

问题重点:为什么这个URL被排除。

检查:

noindex;

canonical;

重复页面;

重定向;

404;

Soft 404;

robots;

服务器错误。

只要先把页面归到正确类别,后面排查一般就没有那么乱。


总结

新站上线以后不收录很常见。

但是不能把所有情况简单理解成:

“新站权重低,再等等就好了。”

有时候确实只是 Google 还没有来得及抓。

但也可能是:

robots.txt 错误;

页面 noindex;

canonical 指错;

URL在跳转;

服务器错误;

Sitemap没有页面;

没有内部链接;

页面内容太薄;

大量模板重复;

Soft 404;

JavaScript正文没有正常加载。

所以真正合理的排查顺序应该是:

第一步,看Google有没有发现URL。

如果没有:

检查 Sitemap、内链和其他发现入口。

第二步,看Google能不能正常抓取。

检查:

200状态;

robots;

服务器;

403;

5xx。

第三步,看页面是否允许索引。

检查:

noindex;

X-Robots-Tag。

第四步,看canonical有没有问题。

确认 Google 是否把其他 URL 当成规范页面。

第五步,看页面是不是正常完整页面。

检查:

Soft 404;

渲染;

空内容。

第六步,再看内容质量。

检查:

内容是不是太薄;

是不是和其他页面重复;

是不是大量模板;

是不是有真正独立价值。

第七步,看网站整体结构。

重要页面有没有内链;

有没有大量标签页、搜索页和参数 URL;

网站主题是否清楚。

特别要分清:

Discovered – currently not indexed

代表:

Google已经发现URL,但还没有抓取。

而:

Crawled – currently not indexed

代表:

Google已经抓取页面,但目前没有进入索引。

这两个状态虽然看起来只差一个词,实际排查方向完全不同。

另外不要把:

Sitemap成功;

Request Indexing成功;

页面返回200

理解成:

Google就必须收录。

Google官方关于搜索工作方式的文档也明确说明,网页经过抓取以后,索引并不是必然发生的。

所以新站真正应该追求的,不是:

“怎么让Google把我所有URL都收录?”

而应该是:

让真正重要的页面容易被发现、能够正常抓取、允许索引、规范化正确,并且本身值得进入搜索结果。

如果这些基础都做好了,再观察 Google Search Console 的变化。

比每天重复提交几十次 URL,更有意义。

赞(0) 打赏
未经允许不得转载:乐予博客 » 新站为什么不收录:从发现、抓取到内容质量逐项排查

需要独立站建站、服务器配置环境服务

联系我们

觉得文章有用就打赏一下文章作者

非常感谢你的打赏,我们将继续提供更多优质内容,让我们一起创建更加美好的网络世界!

支付宝扫一扫

微信扫一扫