这次泄露是怎么发生的
2024 年 3 月,一批疑似来自 Google Search 内部 Content Warehouse API 的文档被自动化账号意外发布到公开 GitHub 仓库,并在第三方文档服务留下副本。代码变更记录显示,相关内容在 5 月初被移除。
SEO 从业者 Erfan Azimi 将材料交给 SparkToro 联合创始人 Rand Fishkin,Fishkin 随后邀请 iPullRank 创始人 Mike King 进行技术分析。两人在 5 月 27 日前后公布调查结果:材料包含 2,596 个模块和 14,014 个属性。
2024-03-27
相关 API 文档进入公开仓库
2024-05-07
公开仓库中的内容被移除
2024-05-29
Google 向媒体回应材料真实性
它是数据字典,不是算法配方
Content Warehouse 可以理解为 Google 搜索系统处理页面和相关信号时使用的数据基础设施。泄露材料描述了大量模块、字段名称、数据类型和部分注释,因此能告诉我们系统保存或传递过哪些信息。
材料能够支持
- · 某些内部系统、模块和字段确实存在
- · Google 收集的数据比公开指南描述得更细
- · 链接、点击、站点和内容信号存在复杂关联
- · 为专利、庭审材料和行业观察提供交叉验证
材料无法直接证明
- · 14,014 个字段全部是当前排名因素
- · 每个字段在最终排序中的具体权重
- · 字段属于实验、存储、调试还是线上系统
- · 某项优化能够带来固定名次或固定周期的增长
因此,把这次事件称为“Google 14,014 个排名因素泄露”很吸引点击,却不够严谨。更准确的说法是:这是目前公开范围内罕见的 Google 搜索内部数据结构快照。
与 SEO 有关的五项核心发现
链接不是简单计数,而是分层处理
材料显示:文档出现 sourceType、PageRank 变体、首页 PageRank 和来源页质量等字段。
我们的判断:Google 对链接来源、页面层级和链接图谱的处理远比“有一条 dofollow 链接”复杂。来源页是否重要、是否进入有效索引层,以及链接所在语境,都可能影响其价值。
锚文本被保存,也被检查垃圾模式
材料显示:材料涉及原始锚文本、上下文及 phraseAnchorSpamCount、phraseAnchorSpamDemoted 等字段。
我们的判断:锚文本依然值得规划,但批量制造相同商业关键词并不是聪明捷径。品牌词、URL 和自然描述性锚文本更符合真实引用分布。
存在站点级信息,但不等于第三方 DA/DR
材料显示:泄露材料中出现 siteAuthority 以及与首页 PageRank 有关的字段。
我们的判断:Google 会保存某些站点级信息,但不能由此断言 Moz DA 或 Ahrefs DR 就是 Google 分数。第三方指标仍只是外部估算工具。
点击与查询数据比公开话术更复杂
材料显示:文档大量提到 NavBoost、goodClicks、badClicks、lastLongestClicks 等名称,并与反垄断案件披露的系统相互印证。
我们的判断:搜索结果中的用户互动可能参与部分系统,但这不等于“刷点击可以提升排名”。Google 同时拥有识别异常互动和点击垃圾的机制。
内容、链接和用户信号处在同一系统链路中
材料显示:字段覆盖标题匹配、日期、实体、链接、点击、质量与降权等多个层面。
我们的判断:把 SEO 简化成内容、外链或体验中的任何单一因素都不准确。真正的竞争力来自页面价值、品牌需求、引用关系和技术基础的组合。
它与 Google 公开说法的关系
Google 官方指南并非毫无价值:它对抓取、索引、链接属性和垃圾政策的说明,是站长判断合规边界的重要依据。但官方文档的目标是帮助网站进入搜索系统并减少滥用,并不是向竞争者公开完整排序工程。
泄露材料的价值,恰恰在于揭示公开表达与内部复杂性之间的距离。例如,公开沟通经常把点击或站点级信号描述得非常简化,而内部字段和已经公开的庭审资料显示,Google 至少保存并处理过远比这种说法复杂的数据。
专业做法不是二选一:既不能把 Google 的每句话当成完整算法说明,也不能看到一个内部字段就宣布找到了排名秘籍。官方资料负责界定已公开事实与政策,泄露材料负责提出更接近内部结构的假设,实际数据负责验证这些假设是否适用于当前网站。
对外链建设的实际启示
来源页比域名标签更重要
不仅检查整站 DR,还要检查具体发布页的主题、入口、收录状态、真实受众和编辑质量。
链接质量不是 dofollow 开关
Google 对链接来源、锚文本、上下文和垃圾模式有更细的处理;属性只是其中一个维度。
品牌与流量不能和链接割裂
品牌搜索、真实访问、媒体提及和编辑链接可能共同形成信号,孤立采购链接越来越难解释长期效果。
新页面需要站点基础支持
首页和站点级信息可能帮助系统理解新页面,但这不意味着高 DR 域名上的所有页面都天然强。
效果必须通过时间序列验证
记录链接、内容和技术变更,再观察目标页展示、点击、查询覆盖、推荐访问和询盘,而不是只交付链接数量。
这也是为什么我们不建议用一个 DR 门槛或固定套餐条数代替审核。可执行方法见外链对 Google 排名的影响和30/60/90 天复盘指南。
如何正确使用泄露材料
| 证据层级 | 如何使用 |
|---|---|
| A级:可确认事实 | 文档来源、字段名称、Google 的真实性回应,以及官方已经公开的系统说明。 |
| B级:有根据的推断 | 字段描述与公开专利、庭审材料或多个系统名称能够相互印证。 |
| C级:行业观察 | 相关性研究、长期案例和多站点实验呈现一致方向,但无法完全控制变量。 |
| D级:项目假设 | 针对特定网站提出的策略,需要通过发布前基线和后续数据验证。 |
最终策略应当从 A、B 级证据出发,用 C 级观察确定优先级,再把 D 级假设放进可复盘的执行周期。这样既不会被 Google 的公关式简化限制,也不会被“泄露排名秘籍”的营销标题带偏。
常见问题
2024 年 Google 搜索文档泄露是真的吗?
是真的。相关材料来自意外公开的 Google 内部 Content Warehouse API 文档。Google 随后向媒体确认文档真实性,同时提醒这些材料可能缺少上下文、已经过时或不完整。
泄露文档公布了 14,014 个排名因素吗?
不能这样表述。14,014 指文档中的属性或字段,其中可能包含排名信号、存储字段、调试信息、已弃用字段或供其他系统使用的数据。文档没有提供完整评分函数,也没有逐项公布权重和启用状态。
泄露文档是否证明外链仍然重要?
它强烈说明 Google 对链接图谱进行了细致的数据工程:文档涉及多种 PageRank 数据、来源页面质量、锚文本、锚文本垃圾检测等字段。但字段存在不等于可以计算某条外链的排名增益,仍需结合官方排名系统说明、行业观察和网站数据。
可以按照泄露字段直接优化网站吗?
不建议逐字段追逐。更可靠的方法是把泄露材料用于形成可验证假设,再用 Search Console、日志、分析工具和对照周期验证。无法被真实用户价值和业务指标支持的技巧,通常不值得长期投入。