Official & first-party evidence · 2026

Google SEO / GEO
官方与一手证据全景手册

系统整理 Google 当前正式指南、公开排名系统、质量评估员指南、Google 内部人员一手发言、美国司法部反垄断案证据、Google 搜索专利与 2024 Content Warehouse 泄露文档。

证据边界:这是一份一手证据汇编、证据解释与执行框架,不是 Google 对本文编排与综合推论的认可或认证。
21
正文编号章节
24
执行摘要结论
109
官方证据条目
22
代表性专利组
187
唯一来源链接
单一 HTML 文件 无 CDN / 无外部字体 无跟踪代码 响应式排版 全文搜索 打印友好

0. 先纠正一个容易误导的表述

严格地说,不存在一份由 Google “背书本文全部结论”的民间文档。能成立的表述只能是:本文的事实基础尽量来自 Google 官方材料、Google 具名员工的一手公开发言、法院认定或庭审证据、Google 专利原文,以及经过来源校验的 Google 内部 API 文档;本文对这些材料的综合、分层与推论仍由本文作者负责。

这一区分不是修辞。它直接决定了证据能支持到什么程度:

  • Google 当前正式文档可以支持“Google 现在公开要求站长怎样做”,但不等于公开了全部排名权重。
  • 法院事实认定和宣誓证词可以支持某些内部系统确实存在或曾经运行,但不自动给出 2026 年的精确实现。
  • 专利可以证明 Google 曾经申请保护某种机制,不能证明该机制当前上线、覆盖所有查询或具有特定权重。
  • 泄露字段可以证明某个字段、数据结构或内部模块在相关代码生成时存在,不能证明它一定是当前生产排名因子。
  • Google 员工公开发言可以解释机制和历史,但旧发言必须让位于更新的正式规范。

本文因此不使用“Google 认证的排名公式”“14,000 个排名因子”“照做即可排名第一”一类不能由证据承担的说法。


1. 执行摘要:最重要的 24 个结论

1.1 SEO 与 GEO 的关系

  1. 对 Google Search 而言,GEO/AEO 仍然是 SEO,不是一套平行的黑箱优化学。 Google 2026-07-10 的正式指南明确表示:AI Overviews 和 AI Mode 建立在核心 Search ranking、quality systems 与 Search index 之上;所谓 AEO/GEO,仍然是在优化搜索体验,因此仍属于 SEO。证据:Optimizing your website for generative AI features on Google Search置信度:高。

  2. Google 生成式搜索公开采用 RAG/grounding 与 query fan-out。 核心排名系统从索引检索相关、较新的页面,模型基于检索材料生成回答并显示支持信息的链接;复杂问题还可能并行生成多个相关子查询。置信度:高。

  3. 进入 AI Overviews / AI Mode 的基础资格仍然来自普通 Search: 页面需已索引、可显示 snippet、满足 Search technical requirements,并且站点在 Search Console 的 Search generative AI control 中被设为 Include。满足这些条件仍不保证抓取、索引或展示。置信度:高。

  4. Google 已明确否定大批“GEO 黑魔法”: llms.txt、AI 专用文本文件、必须 Markdown、机械 chunking、AI 特殊句法、固定长度、覆盖每个 fan-out/长尾变体、虚假品牌 mentions、AI 专用 schema,均不会构成 Google Search 的特殊优势;部分做法还可能触发 scaled content abuse。置信度:高。

1.2 排名系统与内容质量

  1. Google 排名是多阶段、多系统、多信号的候选缩减和重排过程,不是一个公开的固定因子表。 官方、庭审与员工一手材料共同支持:查询理解、候选检索、页面级评分、重排、去重、多样性、垃圾处理、SERP 组合与生成式 grounding 是不同阶段。置信度:高。

  2. 通过技术门槛只是获得资格,不是获得排名。 Googlebot 未被阻止、URL 返回 200、页面有可索引内容并符合政策,只意味着可能被处理;抓取、索引和展示均不保证。置信度:高。

  3. Google 当前公开的系统包括 BERT、RankBrain、neural matching、passage ranking、link analysis/PageRank、freshness、original content、deduplication、exact-match-domain adjustment、reviews、site diversity、reliable information、removal-based demotions 与 SpamBrain 等。MUM 不是通用排名系统。置信度:高。

  4. E-E-A-T 不是一个公开、单一、可直接调节的排名因子。 它是 Google 描述理想结果质量和质量评估目标的概念框架;其中 Trust 最重要,YMYL 要求更高。多个系统可能识别其不同侧面,但不能把它写成一个名为 E-E-A-T score 的公开分值。置信度:高。

  5. 质量评估员不会直接给页面排名。 评估员使用 Needs Met、Page Quality、E-E-A-T 等框架评价系统输出,帮助 Google 衡量算法变更是否朝正确方向发展;其评分不直接控制单页位置。置信度:高。

  6. AI 生成内容本身不违规;以操纵 Search 或生成式回答为目的的大规模低价值生产才是问题。 当前规则看目的、规模、价值、事实准确性和用户结果,而不是生产工具。置信度:高。

1.3 用户交互、点击、链接与站点级信号

  1. “Google 完全不用点击”是错误结论。 2024 年责任判决认定 NavBoost 会把查询与文档配对,并通过记忆用户点击数据工作;Glue 收集查询、结果、SERP 特征及点击、hover、SERP 停留等交互数据。置信度:高(对相关系统存在和历史/审理时用途)。

  2. “每一次点击都是直接排名投票”同样错误。 Google 证据反复说明点击有位置偏差、摘要直接回答、任务类型差异和噪声;系统会聚合、切片、校正和建模。普通站长无法把单页 CTR、GA bounce rate 或某次 pogo-sticking 直接映射成固定排名权重。置信度:高。

  3. PageRank/链接分析仍是核心系统的一部分,但只是众多输入之一。 链接还帮助发现 URL、理解关系与锚文本;合理 surfer、seed distance、link spam 等专利说明了 Google 曾探索或保护的链接评估机制,但专利不证明现行权重。置信度:高(PageRank 仍存在);中等(具体专利机制当前部署)。

  4. 存在站点级或站点相关信号的证据很强,但不能把“站点权威”简化为一个可购买分数。 官方文档承认页面级系统之外也会使用站点范围信号/分类器;DOJ 展品与泄露结构出现 Q*、siteAuthority、hostNsr 等内部概念。它们不等于第三方 DA/DR,也没有公开换算关系。置信度:高(存在站点范围信号);高(不能映射第三方指标)。

  5. 法院并未确认“Chrome 用户访问量就是通用直接排名因子”。 补救判决只说两份展品“suggest” P* popularity 使用 Chrome visit data 与 anchors;因无人作证说明范围,法院明确表示 “can say no more”,并拒绝强制披露该信号。置信度:高。

1.4 技术 SEO、结构化数据与测量

  1. robots.txt、noindex、canonical、sitemap 是不同控制层。 robots 阻止抓取但不能保证移除索引;noindex 必须被抓取才能看到;canonical 是强提示而非绝对指令;sitemap 是发现/规范 URL 的提示,不是收录命令。置信度:高。

  2. 重复内容通常是去重与 canonical 问题,不是自动处罚。 只有欺骗、操纵、抄取或大规模低价值复制等行为才进入 spam policy。置信度:高。

  3. 结构化数据帮助理解并取得 rich-result 资格,不保证 rich result,也没有 Google 官方承诺的通用排名加成;它不是生成式搜索的额外资格要求。 置信度:高。

  4. Core Web Vitals 是体验指标,不是排名保证。 当前良好阈值为 LCP 不超过 2.5 秒、INP 低于 200 毫秒、CLS 不高于 0.1;Google 没有一个单一的 “page experience signal”,完美分数也不能弥补低相关性或低价值内容。置信度:高。

  5. Search Console 是第一方诊断工具,不是 Google 内部排名数据窗口。 报告有采样、聚合、canonical 归因、行数和维度限制;average position 不是每次查询的固定真实位置。置信度:高。

  6. 2026 年生成式 AI 报告仍是部分站点逐步推出。 Search 视图可见 impressions、pages、countries、devices、dates;当前不提供 clicks、CTR、query、回答文本、citation rank 或 fan-out query。置信度:高。

1.5 专利、DOJ 与泄露文档应该怎样读

  1. 专利是“机制披露”,不是“生产配置证明”。 最相关的生成式搜索家族 US11769017B1 描述了根据查询与响应文档生成摘要、处理相关/隐含查询、计算置信度并链接可验证来源;它与 AI Overviews 的公开形态高度相似,但不能当作当前产品的完整实现说明书。置信度:高(专利披露);低至中等(与当前产品逐项对应)。

  2. 2024 Content Warehouse 泄露是真实的一手内部结构材料,但不是完整算法。 原始 2024-03-13 提交中可独立计数到 2,587 个模型文件与 14,062 条字段定义;这些是模块/字段,不是 14,062 个排名因子。文档不提供完整调用图、生产开关、权重、阈值、实验状态或 2026 现状。置信度:高。

  3. 泄露最有价值的用法是与更强证据交叉确认,而不是单独生成教程。 例如 NavBoost/点击、Q*/质量、PageRank、freshness、original content、spam、site-level data 等名称可与 DOJ 证词、法院认定及官方指南相互印证;chromeInTotalsiteAuthorityhostAge 等单字段不能被直接翻译为可操作排名公式。置信度:高。


2. 研究范围、证据等级与判断规则

2.1 纳入与排除

本文纳入:

  1. Google Search Central、Google Crawling Infrastructure、Search Console Help、Google Business Profile、Merchant Center、Google News、The Keyword 等 Google 官方材料;
  2. Google 具名搜索工程师、产品负责人、Search Liaison 在 Google 官方渠道中的原始发言;
  3. 外部会议中的 Google 员工原始完整录像,仅用于历史解释;
  4. 美国司法部 United States v. Google LLC 案的法院判决、最终判决、宣誓证词引用与已接纳展品;
  5. Google Patents 中的专利说明书、权利要求与法律状态元数据;
  6. 2024 年 Content Warehouse 公开 Git 历史、生成的 API 模型文件和 Google 发给媒体的原始回应。

本文排除:

  • 第三方 SEO/GEO 教程、排名因子清单、相关性研究、工具分数、实验案例和“最佳实践”;
  • 第三方对 Google 材料的二次解读;
  • 无法回到原始证词、展品、代码、专利或官方文档的转述;
  • 把专利、字段名、产品外观或统计相关性直接当作现行生产算法的推测。

唯一例外是:Google 对泄露事件没有发布独立官方网页,其原始声明由媒体直接收取并刊载。本文仅采用声明本身,并把载体标为“经媒体传递的 Google 一手声明”,不采纳文章作者的 SEO 分析。

2.2 两条并行的证据排序

“哪个证据更强”取决于所问问题,不能用一条总排行榜粗暴处理。

问题 第一优先 第二优先 低优先/仅作补充
2026 年站长现在应遵守什么 当前 Google 正式规范与帮助文档 当前官方公告/具名员工解释 旧发言、专利、泄露
某内部系统是否存在或曾如何工作 法院事实认定、宣誓证词 已接纳内部展品 员工访谈备忘录、泄露、专利
Google 曾披露过哪些技术方案 专利说明书/权利要求 论文、官方技术博客 产品外观推测
泄露字段到底能证明什么 原始 Git 提交和字段注释 Google 对真实性/语境的回应 第三方解读(本文不采用)
一个动作能否提高排名 当前官方明示 + 多源交叉证据 法院/内部机制佐证 单独专利、单字段、旧口头发言

2.3 证据标签

标签 证据类型 典型用途 固有限制
G1 当前 Google 正式文档/帮助中心 当前规范、资格、政策、控制与测量 不公开完整权重和反作弊细节
G2 Google 官方博客/公告/具名员工官方发言 机制、推出时间、设计意图与历史演进 可能被后来规范取代
C1 法院事实认定/最终判决 已由法院采纳的事实和补救边界 只覆盖诉讼记录、时间与争点
C2 判决引用的宣誓证词/已接纳展品 内部系统、数据与流程 可能被涂黑;时点通常早于判决
C3 已接纳的工程师访谈/电话备忘录 具体内部术语和工程解释 不是宣誓证词,也非逐字稿
P Google 专利 机制存在、技术构想与权利要求 不证明当前部署、覆盖或权重
L 泄露的原始生成代码/API schema 字段、模块、注释、历史快照 无完整调用图、开关、权重与现状
E 外部会议中的员工原始录像 历史架构、实验方法与语境 历史性强,不能覆盖当前规范
X 本文综合推论 把多类证据连接成可检验判断 必须明确是推论,不冒充原文

2.4 置信度

  • 高: 当前正式规范直接明示,或法院认定/多个一手来源相互一致。
  • 中等: 一手证据可信但历史性、语境、覆盖范围或生产状态不完整。
  • 低: 只有专利或孤立字段等“可能性证据”,缺乏部署证明。
  • 未知: 一手材料不足,不能诚实得出结论。

2.5 五条硬性推理规则

  1. 资格不等于排序。 “可索引、可显示、可进入 rich result/AI feature”不能改写成“会排名更高”。
  2. 被收集不等于被使用。 字段存在、日志存在、数据被保留,不自动证明它参与当前排序。
  3. 被使用不等于直接因子。 某数据可能用于训练、实验评估、去偏、抓取优先级、反垃圾、候选生成或产品展示,而非最终直接打分。
  4. 专利不等于上线。 专利常覆盖更广的实现可能性,甚至被放弃、过期或从未生产部署。
  5. 历史事实不等于当前配置。 所有可变机制都标注证据时间;2026 当前规范优先于 2009、2016、2019 或 2023 的旧说法。

3. 一张图看懂 Google Search 与生成式搜索的共同管线

URL 发现
  ├─ 可抓取链接
  ├─ sitemap / feed
  ├─ 已知 URL / 重定向 / 外部发现
  ↓
抓取与资源获取
  ├─ robots.txt / HTTP 状态 / 服务器容量
  ├─ HTML、PDF、CSS、JS、图片、视频
  ↓
渲染与内容理解
  ├─ 初始 HTML + Web Rendering Service
  ├─ 文本、标题、链接、媒体、结构化数据、语言、实体
  ↓
索引、去重与 canonical
  ├─ 是否保留
  ├─ 重复聚类、代表 URL、索引层级与新鲜度
  ↓
查询理解
  ├─ 拼写、同义词、概念、意图、语言、地点、新鲜度需求
  ├─ BERT / RankBrain / neural matching 等
  ↓
候选检索与逐级缩减
  ├─ 从海量文档到较小候选集
  ├─ 词项、语义、链接、质量、行为等多类系统
  ↓
评分、重排与结果页组合
  ├─ 相关性、质量、PageRank/链接、新鲜度、NavBoost 等
  ├─ 垃圾处理、去重、多样性、垂直结果与 SERP feature 组合
  ↓
普通 Search 结果
  └─ title link、snippet、rich result、图片、视频、本地、商品等

同一个 Search index / ranking foundation
  ↓
生成式搜索附加阶段
  ├─ query fan-out:并发相关子查询
  ├─ RAG / grounding:从 Search 检索当前证据
  ├─ 模型综合、格式化、置信与安全处理
  └─ AI Overview / AI Mode 回答 + 支持信息的可点击链接

这张图最重要的不是系统名称,而是因果顺序:如果页面没有被发现、抓取、理解、索引并成为可检索候选,后面的排名或生成式引用无从发生;但通过任何前一阶段都不保证通过后一阶段。

主要证据:How Google Search worksSearch technical requirementsAI optimization guide责任判决 ECF 1033 ¶¶27–32、补救判决 ECF 1436 关于 grounding、Glue、RankEmbed 与 FastSearch 的认定。

综合置信度:高。


4. Google 当前正式 SEO 规范:从资格到展示

4.1 Search Essentials 是最高层入口

Google 当前把基础要求组织为三层:

  1. Technical requirements: 成为候选结果的最低技术门槛;
  2. Spam policies: 可能导致算法处置、人工处置或移除的行为;
  3. Key best practices: 最有助于 Google 发现、理解和展示内容的做法。

核心来源:

最低技术要求只有三类:Googlebot 未被阻止、URL 返回成功状态、页面具有可索引且合规的内容。官方同时反复强调:满足条件不保证抓取、索引或提供结果。

Google 还明确表示:自然搜索结果不能通过付费从 Google 购买更高排名;声称能保证第一名、能访问 Google 内部排名数据或与 Google 有特殊关系的第三方,不应被当成官方证据。参见 Do you need an SEO?Guidance on third-party SEO tools, services, and advice

置信度:高。

4.2 发现与可抓取链接

Google 主要通过已知页面中的链接和 sitemap 发现 URL。对站内关键导航,最可靠的形式仍是带可解析 href 的 HTML <a> 元素;链接文字应让用户和系统理解目标内容。参见 Links crawlable by Google

可执行结论:

  • 关键页面必须能从其他已知页面通过真实链接到达;
  • 不要只依赖点击脚本、表单、画布或没有 href 的元素承载唯一导航;
  • 锚文本应自然、具体、能描述目标,不要机械堆积完全匹配关键词;
  • 链接发现只是入口,不保证目标被抓取或索引;
  • 付费、赞助与 UGC 链接分别使用 rel="sponsored"rel="ugc"nofollow 仍可使用;这些属性对 Google 是 hint,而非绝对屏蔽指令。参见 Qualify outbound links

置信度:高。

4.3 Googlebot、文件大小与抓取预算

当前 What is Googlebot 与 Gary Illyes 的 2026 官方解释 Inside Googlebot 支持以下结论:

  • Googlebot 是中央抓取基础设施的一个 Search 客户端,不是单一孤立程序;
  • Google 主要使用移动版 Googlebot;
  • 普通 URL 当前最多处理前 2 MB,包含 HTTP headers;
  • PDF 当前限制为 64 MB
  • CSS、JavaScript、图片等子资源各自请求,各自计算限制;
  • Web Rendering Service 使用现代 Chrome,但请求间不保留 local storage/session 状态;
  • 超过限制的尾部内容对该抓取请求相当于不存在,关键 <title>、meta、canonical、正文入口和必要结构宜尽早出现。

这取代了 2022 年 Googlebot “15 MB” 的旧口径。Google 通用抓取基础设施可能有其他默认值,但不能再把 15 MB 写成当前 Googlebot 的 Search 抓取上限。

Crawl Budget Management 只建议超大型、频繁变化或出现大量 Discovered - currently not indexed 的站点重点管理 crawl budget。官方框架是:

  • crawl capacity limit: 不压垮服务器的抓取能力;
  • crawl demand: Google 对已知 URL 的抓取需求。

实际工作应优先消除无限参数、无意义重复 URL、重定向链和服务器错误;准确维护 lastmod;永久删除返回 404/410;不要把 noindex 当作主要节省抓取方法,因为 Google 仍需抓取才能看到它。

置信度:高。

4.4 HTTP 状态、robots、noindex 与移除

来源:HTTP status codes and Google SearchRobots.txt introductionRobots meta tag specificationsBlock indexing with noindex

控制 主要作用 不能推出的结论
200 内容可被纳入索引考虑 不保证索引
301 / 308 强的永久目标信号 不保证立即迁移全部信号
302 / 307 较弱的临时目标信号 不是永久 canonical 的同义词
404 / 410 URL 不存在,持续后从索引移除 Google 对二者核心处理没有神奇速度保证
429 / 5xx 过载/服务故障,持续会降低抓取 不是正常的 SEO 控制手段
robots Disallow 阻止抓取路径 不保证 URL 从索引消失;外部信号可能留下 URL-only 结果
noindex 阻止出现在 Search 必须允许抓取,Google 才能看到该规则
nosnippet 禁止文本摘要/视频预览,并限制内容作为 Search AI 直接输入 不是访问控制或保密机制
data-nosnippet 排除页面指定片段进入摘要 不排除页面其他内容
max-snippet 限制摘要长度,也限制 Search AI 可直接使用的文本量 不代表完整退出 Search
Removals 工具 临时快速隐藏 不是永久删除、canonical 或安全措施
密码/身份验证 保护私密内容 robots.txt 不能替代

关键错误是同时 Disallownoindex:前者可能阻止 Google 看到后者。

置信度:高。

4.5 Sitemaps、分页、分面导航与 URL

来源:Sitemaps overviewBuild and submit a sitemapFaceted navigationURL structurePagination

  • sitemap 是发现和 canonical 候选提示,不保证抓取、索引或排名;
  • 单文件最多 50 MB(未压缩)或 50,000 个 URL;
  • 只提交希望成为 canonical 的绝对 URL;
  • Google 忽略 <priority><changefreq>
  • lastmod 只有持续准确、反映实质性变化时才有用,页脚年份变化不算;
  • 分页页面要有独立 URL,并以可抓取 <a href> 互联;无限滚动应提供等价分页;
  • 不要把所有分页 canonical 到第一页,除非内容确实重复;
  • 分面组合会制造近乎无限 URL,应限制无价值组合并保持参数顺序稳定;无结果组合可返回 404;
  • fragment # 不适合承载需要独立索引的主内容。

置信度:高。

4.6 JavaScript 渲染

来源:JavaScript SEO basicsFix Search-related JavaScript problemsDynamic rendering

Google 通常先处理初始 HTML,再将需要渲染的页面排队;渲染后的 HTML参与索引。可执行边界:

  • Google 能执行 JavaScript,不代表所有脚本都及时、成功或低成本执行;
  • SSR、静态生成或预渲染仍能提高稳定性、速度和非 Google 爬虫兼容性;
  • 不要阻止理解页面所需的 JS/CSS;
  • 路由应有可直接访问的 URL,SPA 使用 History API;
  • 服务器应返回真实状态,避免所有不存在页面都返回 200 的 soft 404;
  • canonical 最好在初始 HTML 中确定,不要由 JavaScript 改成冲突目标;
  • 初始 HTML 中的 noindex 可能使 Google 不再继续渲染,不能假设稍后用 JS 删除一定生效;
  • dynamic rendering 现在只是 workaround,不是长期推荐;对爬虫和用户提供实质不同内容可能构成 cloaking。

置信度:高。

4.7 Mobile-first indexing

来源:Mobile-first indexing best practices 与 John Mueller、Nir Kalush 的官方公告 Mobile-first indexing has landed

Google 主要以移动版内容抓取和索引。移动版应保留与桌面版等价的:

  • 主正文、标题和 meta;
  • structured data;
  • 图片、视频和 alt;
  • robots 指令与 canonical/hreflang 关系;
  • 足够的内部链接。

移动端为了布局隐藏关键内容、输出不同 robots 或缺少结构化数据,会让 Google 看到一个更贫乏的主版本。

置信度:高。

4.8 Canonical、重复与重定向

当前来源:Specify a canonical URLCanonical troubleshooting

Google 当前公开的信号强弱是:

  • 重定向:强信号;
  • rel="canonical":强信号;
  • sitemap:弱信号;
  • 一致信号可以叠加。

但 canonical 始终是提示。Google 可在其判断另一 URL 更适合代表重复聚类时另选。正确做法是:自引用 canonical、内链统一指向 canonical、sitemap 只列 canonical、hreflang 与 canonical 不冲突、避免 JS 改写冲突目标。robots.txt 与 Removals 工具不用于 canonical。

重复内容通常不会触发一个名为 “duplicate content penalty” 的自动处罚;主要结果是抓取浪费、信号分散、代表 URL 不符合预期和重复结果被过滤。操纵性抄取、批量低价值复制另受 spam policies 处理。

置信度:高。

4.9 Title link、snippet、meta 与 headings

来源:Title linksSnippetsSEO Starter Guide

  • Google 可从 <title>、页面主视觉标题、<h1>、显著文本、锚文本和其他信号生成 title link;<title> 是重要输入,但不是展示命令;
  • title 应唯一、描述性强、简洁且避免 boilerplate 与关键词堆积;
  • snippet 主要从页面内容生成,必要时可能使用 meta description;
  • meta description 的价值主要在准确概括和吸引适合用户,不是公开的直接排名加分;
  • Google 不使用 meta keywords;
  • heading 有助于用户与系统理解结构,但没有“只能一个 H1”“标题层级顺序错误会被惩罚”或“标题数量公式”的官方排名规则。

置信度:高。

4.10 结构化数据

来源:Introduction to structured dataStructured data general guidelines

结构化数据的正确因果链是:

准确、与可见内容一致的受支持标记
  → 帮助 Google 理解页面实体/属性
  → 获得某类 rich result 的资格
  → Google 仍自行决定是否展示

它不支持以下说法:

  • schema 会直接提高普通蓝链排名;
  • 通过 Rich Results Test 就必定展示;
  • 越多类型越好;
  • 隐藏、误导或与页面不一致的标记有效;
  • 生成式搜索需要 AI 专用 schema。

置信度:高。

4.11 页面体验与 Core Web Vitals

来源:Understanding page experienceCore Web Vitals

当前良好体验阈值:

指标 良好阈值(75 分位) 描述
LCP ≤ 2.5 秒 主要内容加载
INP < 200 毫秒 交互响应
CLS < 0.1 视觉稳定性

Google 说的是多个页面体验方面可能被系统考虑,并不存在一个单一 “page experience signal”。相关性仍是首要条件;CWV 满分、HTTPS、无插页或移动友好都不能保证更高排名。优化它们的主要理由首先是用户体验和业务结果。

置信度:高。

4.12 国际化、本地、商品、图片、视频与 News

这些不是独立于 SEO 的“特殊权重”,而是不同内容类型的资格和数据完整性要求:

  • 多语言/多地区:使用独立 URL、双向且自引用的 hreflang、合法语言/地区码和 x-default;不要根据 IP 或猜测语言强制跳转。来源:Localized versions
  • Local:Business Profile 信息应真实、完整、准确;本地结果主要围绕 relevance、distance、prominence,不能付费购买更好的本地自然排名。来源:Improve local ranking
  • Ecommerce:网页结构化数据与 Merchant Center feed 可互补,价格、库存、变体、运输与退货信息应一致。来源:Ecommerce in Google Search
  • 图片/视频:可抓取、上下文相关、高质量、准确 alt/thumbnail/metadata;重要视频应有专门观看页面。来源:Google Images best practicesVideo SEO
  • News:发布者无需提交网站即可获得 Google News 展示资格;合规内容会被系统自动发现并纳入考虑,但不保证每篇文章获得发布或排名。Google News 已转向自动生成 publication pages,Publisher Center 的手工配置不是纳入或排名保证;新闻政策、原创性、透明作者与日期仍是资格与信任基础。来源:Help Google News discover your web crawled contentGoogle News transitions to automatically-generated publication pagesGoogle News policies

置信度:高。


5. 内容质量、E-E-A-T、YMYL 与垃圾政策

5.1 People-first 的可观察标准

Google 的 Creating helpful, reliable, people-first content 不提供字数或关键词密度公式,而要求从内容结果反推:

  • 是否有原创信息、报道、研究、测试或分析;
  • 是否完整、实质性覆盖主题;
  • 是否提供超出显而易见结论的洞见;
  • 引用他人时是否增加显著原创价值;
  • 标题是否准确、描述性强而非夸张诱导;
  • 是否明确来源、作者、作者背景和网站背景;
  • 是否体现第一手经验或可验证专业知识;
  • 网站是否有清楚的主要目的与真实受众;
  • 用户访问后是否能完成任务,而不是被迫继续搜索;
  • 所谓更新是否真的改变了内容,而非只改日期。

Google 明确警惕:为搜索流量无差别进入大量陌生主题、批量生成低价值页面、复述公共知识、追逐传闻字数、伪造发布日期、虚构未公布答案、为每个查询变体建页。

这不是“内容写作风格偏好”,而是多个官方系统希望识别的质量结果。

置信度:高。

5.2 E-E-A-T 的准确地位

Google 官方口径可以压缩成四句话:

  1. E-E-A-T 是 Experience、Expertise、Authoritativeness、Trustworthiness;
  2. Trust 最重要;
  3. 它不是一个特定、单一的排名因子;
  4. 系统可能用多个信号识别这些属性,质量评估员则用它评价系统结果。

因此:作者简介、资质、引用、编辑流程、联系方式、关于页、第一手照片或测试记录等,只有在它们真实证明内容和责任主体时才有价值;把这些元素机械补齐并不能“生成 E-E-A-T 分数”。第三方 DA/DR、作者权威分或模板化 expert review 没有官方换算关系。

置信度:高。

5.3 YMYL

Google 的 Search Quality Rater Guidelines 将可能显著影响健康、财务稳定、安全、社会福祉等主题视为 YMYL。对这类查询,错误信息的代价更高,因此强 E-E-A-T、可靠来源和事实准确性要求更严。

本文核验的 2025-09-11 版 QRG 共 182 页;变更记录显示 2025-09 更新了 YMYL 指导,2025-01 将 Lowest/Low 的相关部分与当时 spam policies 对齐。QRG 同时明确:评分用于评估系统,不直接改变被评页面的排名。

置信度:高。

5.4 AI/自动化内容

Google 的当前原则来自 Guidance on using generative AI content2023 AI-generated content announcement 与当前 spam policies:

  • AI 或自动化作为工具本身不违规;
  • 用它辅助研究、组织、草拟或改写可以合理;
  • 事实、来源、元数据、图片 alt 与 structured data 仍需准确;
  • 用户合理预期了解生产方式时,可披露自动化或 AI 参与;
  • 主要为了操纵普通排名或生成式 AI 回答而大规模生产无价值内容,属于或可能属于 scaled content abuse;
  • 当前政策明确不区分人工、AI 或混合生产,判断的是目的与结果。

置信度:高。

5.5 Spam policies 的当前边界

当前 Spam policies 覆盖:

  • cloaking;
  • doorway abuse;
  • expired domain abuse;
  • hacked content;
  • hidden text/link abuse;
  • keyword stuffing;
  • link spam;
  • machine-generated traffic;
  • malware 与欺诈;
  • misleading functionality;
  • scaled content abuse;
  • scraping;
  • site reputation abuse;
  • sneaky redirects;
  • thin affiliation;
  • UGC spam 等。

2026 当前文本还明确把“操纵生成式 AI 回答”纳入相关违规目的。三个尤其容易被偷换的概念:

  • scaled content abuse 看规模与操纵目的,不看是否由 AI 生成;
  • site reputation abuse 针对第三方内容主要因为宿主站既有排名信号而发布、意图获得其独立站点难以取得的排名优势;是否有第一方参与、监督或审核,不是决定性的豁免条件。这不等于所有客座内容、原生广告、论坛或第三方投稿都违规;
  • expired domain abuse 针对购买过期域名并利用历史信誉承载低价值操纵内容,不等于所有合法品牌迁移或域名收购。

置信度:高。


6. Google 当前公开的排名系统与它们不能说明什么

核心来源:A guide to Google Search ranking systems

系统/类别 官方公开功能 可以得出的结论 不能得出的结论
BERT 理解词语组合的意义和意图 精确词匹配不是唯一相关性路径 页面写成“BERT 风格”会加分
RankBrain 理解词与概念关系 未出现精确词也可能相关 有公开可优化的 RankBrain 分数
Neural matching 匹配查询与页面概念表示 语义匹配参与理解 第三方 embedding 相似度等于 Google 分数
Passage ranking 理解页面具体段落与查询的相关性 长页面的局部也可被理解 必须机械 chunking 或一问一页
Link analysis / PageRank 分析页面间链接与重要性 PageRank 仍属核心系统 链接是唯一或固定第一权重
Freshness systems 在适合的查询中提高新鲜信息重要性 新鲜度是 query-dependent 改日期即可获得加成
Original content systems 突出原创内容/原创报道 原始来源有系统性价值 所有“原创”都自动优于更可靠来源
Deduplication 合并/过滤相似结果 重复通常先被去重 重复一定受到处罚
Exact match domain adjustment 防止域名词语获得过度信用 精确匹配域名没有自动捷径 域名关键词完全无任何理解价值
Reviews system 识别深入、原创、专家/爱好者评论 第一手测试和洞见重要 评论模板或长度有固定公式
Site diversity 通常避免同站占据过多顶端普通结果 SERP 是整体组合问题 永远只显示同站两个结果
Reliable information 提高可靠、权威信息或显示提示 可靠性会随查询风险提高 有单一“权威域名白名单”
Removal-based demotions 大量有效移除请求可形成站点级信号 某些滥用具有站点级后果 一次投诉就全站降权
SpamBrain 等 自动识别垃圾与违规 反垃圾是独立重要层 可从单次排名下降识别具体分类器
MUM 用于部分特定功能 Google 有能力使用多模态模型 MUM 是当前通用排名算法

历史演进:Helpful Content system 于 2024-03 并入核心排名系统;Panda 于 2015、Penguin 于 2016 并入核心;Hummingbird 是历史性整体改进。把这些名字继续当成可独立追踪的现行“开关”会制造错误诊断。

Google 还说明:系统主要按页面工作,但也会使用站点范围信号和分类器;好的站点信号不保证每页都高,坏的站点信号也不保证每页都低。页面级与站点级不是二选一。

置信度:高。


7. Google GEO / 生成式搜索:当前官方完整框架

7.1 Google 的正式定性:GEO 仍是 SEO

Google 2026-07-10 的 生成式搜索优化指南 是截至检索日的最高优先级材料。它直接给出三层事实:

  1. AI Overviews 与 AI Mode 根植于核心 Search ranking、quality systems 和 Search index;
  2. RAG/grounding 依赖核心排名系统从索引检索相关、较新的页面;
  3. AEO/GEO 从 Google Search 的角度仍是优化搜索体验,因此仍是 SEO。

这意味着:技术可访问性、索引资格、相关性、质量、垃圾处理、媒体、商品、本地数据和站内体验仍构成底座;生成式层增加的是查询扩展、检索组合、回答生成、引用呈现与新的控制/报告,而不是给站长开放另一套隐藏标记。

置信度:高。

7.2 RAG / grounding

官方描述的因果链:

用户问题
  → 核心 Search ranking systems 检索相关且较新的网页
  → 模型审查检索到的具体信息
  → 生成更可靠、较新的回答
  → 显示支持信息的显著可点击网页链接

官方机制直接支持:

  • 没有普通索引资格,就没有这一 Search grounding 路径;
  • 检索、回答中的支持链接及其呈现仍由 Google 系统决定,没有站长可提交的固定“引用申请”机制。

本文的 X 级策略推导:

  • 对具体主张提供清楚、可核验的支持,理论上比抽象“提到品牌”更符合 grounding 的证据需求;
  • 原创事实、第一手测试和独有数据可能提高页面的信息增量,但 Google 没有承诺这会带来引用。

不能推出:

  • 每个回答句子都由单一引用页面生成;
  • 链接顺序等于传统排名顺序;
  • 被模型读取就一定显示链接;
  • 站长能通过固定段落长度或问答格式触发引用;
  • 传统蓝链第一名必然成为 AI 回答首要来源。

置信度:机制与产品边界为高;上述策略推导为中等。

7.3 Query fan-out

Google 说明模型会为复杂问题并发生成相关子查询,取得更广的搜索结果。这能支持:生成式搜索的候选来源可能来自用户原始查询之外的相关检索。

它不能支持“为每个 fan-out query 建独立页面”。同一指南立即警告:为了覆盖所有搜索变体而大规模创建页面,可能违反 scaled content abuse;Google 的语言理解系统并不要求精确词逐一匹配。

严谨执行方向是:围绕一个真实任务提供完整、结构清楚、可验证的内容和必要的相邻信息,而不是猜测并批量铺设子查询页。

置信度:高。

7.4 当前资格条件

截至 2026-07-10,页面进入 Google Search 生成式功能需要:

  • 已被 Google 索引;
  • 有资格在普通 Search 显示 snippet;
  • 满足 Search technical requirements;
  • 站点/属性在 Search Console 的 Search generative AI control 中为 Include;
  • 未被适用的页面级 preview controls 排除相关内容;
  • 符合 Search policies。

仍然没有保证:Google 可能不抓取、不索引、不展示,也可能检索页面但不在最终回答显示链接。

置信度:高。

7.5 Google 逐条否定的 GEO 迷思

主张 Google 当前结论 证据等级 判断
Google 需要 llms.txt Search 不使用;创建不伤不助 Google 排名/可见性 G1 否定,置信度高
必须提供 AI 专用 txt、Markdown 或机器文件 不需要 G1 否定,置信度高
页面必须切成很小 chunks 无此要求;系统能理解一页多个主题及相关段落 G1 否定,置信度高
AI 偏好固定页长/短页 没有理想长度,应按主题与受众决定 G1 否定,置信度高
必须写成 AI 特殊句法 不需要;系统理解同义词与一般意义 G1 否定,置信度高
每个 long-tail/fan-out 变体都要建页 不需要;操纵性批量生产可能违规 G1 否定,置信度高
大量 mentions 本身提高引用 虚假/非真实 mentions 无帮助,且会被垃圾系统处理 G1 否定,置信度高
需要 AI 专用 schema.org 类型 不存在 G1 否定,置信度高
structured data 是进入 AI 回答的必要条件 不是;继续用于普通 rich results G1 否定,置信度高
第三方 GEO 工具能看到 Google 内部 AI 指标 没有第三方能访问内部 ranking/AI systems G1 否定,置信度高
AI 搜索已完全抛弃传统索引与排名 官方说法相反 G1 + C1 否定,置信度高

7.6 Google 真正强调的内容

Google 2026 指南把最强的长期影响放在:

  • unique: 有独特观点或信息;
  • expert-led / experienced: 来自真实专业或第一手经验;
  • non-commodity: 不只是任何模型或聚合者都能轻易复述的公共知识;
  • clear for humans: 段落、章节、标题服务于读者理解;
  • multimodal where useful: 用高质量图片和视频支持文本;
  • satisfying: 访客完成任务后是否满意。

“独特”不是故意反常,“expert-led”不是挂名专家,“non-commodity”也不是必须制造专有名词。它们的共同点是:页面包含可归因、可核验、对用户决策有增量价值的信息。

置信度:高。

7.7 页面级预览与 Search AI 内容控制

当前 Robots meta tag specifications 给出:

  • nosnippet:不显示文本摘要和视频预览,并阻止页面内容作为 AI Overviews / AI Mode 的直接输入;
  • data-nosnippet:排除页面指定片段;
  • max-snippet:限制摘要字符数,同时限制可作为 AI Overview / AI Mode 直接输入的内容量;
  • noindex:完全退出 Google Search。

max-snippet 的限制不一定适用于发布者通过页面内结构化数据、许可协议或其他独立方式另行授予 Google 使用权限的内容;因此它不能被视为覆盖所有授权关系的统一上限。

这些规则控制预览和直接输入,但不应被扩大解释为版权许可、模型训练、Google 对页面的所有理解路径或其他 Google 产品的统一开关。

置信度:高。

7.8 Search Console 站点级生成式 AI 控制

Search generative AI control 在检索日仍为部分站点逐步推出。范围包括 AI Overviews、AI Mode 与 Discover 中的生成式 AI 功能。

选项 当前官方效果
Include 默认;允许站点链接/内容出现在相关生成式功能并参与 grounding
Exclude 不展示站点链接/内容、不参与这些功能 grounding,也不获得相应 impressions/traffic
Inherit from parent 子 property 继承最近配置的父 property,也可单独覆盖

边界:

  • 配置变更通常需要数天处理;控制已经生效后,相关内容通常会在 1–2 天内从适用生成式功能中排除,缓存和传播可能使完整反映变化耗时更久;
  • 不是普通 Search 的 ranking/indexing signal;
  • 不改变 Merchant Center、Ads 等独立产品选择;
  • 不控制模型训练;
  • 完全退出 Search 应使用 noindex
  • 这是 property 范围的产品控制,不等同 robots.txt crawler rule。

置信度:高。

7.9 Google-Extended:不要混淆训练、grounding 与 Search 展示

Google's common crawlersGoogle-Extended 的当前产品范围是:

  • 未来 Gemini 模型训练;
  • Gemini Apps;
  • Vertex AI API for Gemini;
  • Gemini Apps 与 Vertex 的 Google Search grounding;
  • 不影响 Google Search inclusion;
  • 不作为 Google Search ranking signal。

Search Console 控制页面又把模型训练控制指向 Google-Extended。两页并不必然矛盾,但产品枚举没有完全相同。安全结论只能是:

  • Search AI 链接展示与 grounding 的直接站点级控制: Search Console 新控制;
  • Google 所列 Gemini 模型训练/相关产品使用控制: Google-Extended;
  • 不能声称 Google-Extended 会阻止 Google Search 普通收录、排名,或等同于 Search Console 的 Search AI Exclude。

置信度:中高。 原因不是来源不可靠,而是两个官方页面的产品措辞尚未完全统一。

7.10 生成式 AI Performance report

来源:官方发布公告Generative AI performance report — SearchDiscover report

Search 报告当前包括 AI Overviews 与 AI Mode,并提供:

  • impressions;
  • pages;
  • countries;
  • devices;
  • dates(小时、日、周、月)。

当前不单独提供:

  • clicks;
  • CTR;
  • queries;
  • AI 回答文本;
  • citation rank;
  • fan-out queries。

数据边界:Search Labs 实验不计入;数据仍同时包含在整体 Performance report;Pages 以最终链接并按 canonical 归因;图表与表格聚合方式可能不同;同一站点在同一生成式结果出现多个链接时,property 聚合通常只计一次;表格仍受普通报告的行数等限制。

Discover 报告提供 impressions、pages、countries、dates;链接需滚入视野才计曝光。同一 session 反复滚动通常只计一次。

置信度:高。

7.11 Agentic experiences 与 UCP

Google 2026 指南把 browser agents、DOM、accessibility tree、视觉渲染和 Universal Commerce Protocol 放在“有余力可探索”的独立层,而不是 Search ranking 资格。

这能支持:对依赖预订、比较、购买、表单或账号流程的业务,清晰 DOM、可访问性、稳定交互、准确商品/业务数据和新协议可能影响 agent 能否完成任务。

不能支持:UCP、accessibility tree 或 agent-friendly markup 会直接提高普通 Search 或 AI Overview 排名。Google 自己把它放在新兴 agentic experiences,而非核心 SEO 必需项。

置信度:高(产品边界);未知(未来采用范围与排名关系)。


8. DOJ 反垄断案:法院、证词与内部展品究竟证明了什么

8.1 案件与原始来源

核心案件:United States et al. v. Google LLC, No. 1:20-cv-03010-APM(D.D.C.)。

原始来源入口:

本文引用页码时同时给出裁判书印刷页和 PDF 页,以免封面页造成偏移。

8.2 诉讼证据等级

从强到弱:

  1. 法院明确事实认定或最终判决(C1);
  2. 法院采纳并引用的宣誓证词/内部展品(C2);
  3. 已接纳但非宣誓、非逐字的工程师访谈备忘录(C3);
  4. DOJ proposed findings、closing deck 或律师论证(当事方主张);
  5. 本文推论。

DOJ 是诉讼一方,其 proposed findings 不是“政府认证事实”。只有被法院采纳的部分才升级为法院认定。这个区别对所有“Google 算法被 DOJ 公布”的说法是致命的:最终判决明确排除了算法、排名信号和 post-trained LLM 的强制披露。

8.3 法院认定的基础 Search 管线

责任判决 ¶¶27–32(裁判书 pp.14–16;PDF pp.18–20)认定了一个简化管线:

  • 搜索引擎抓取不断变化的公开网页;
  • 把抓取结果组织进 index;
  • 未进入 index 的站点不能在查询结果中呈现;
  • 查询理解包括拼写、同义词、多词概念、相关词、query clustering/segmentation 等;
  • 从海量网页逐步缩减:先决定哪些值得更细评分,再从数百候选中选出约前十个结果。

这与 Google 当前的 How Search Works 一致,也反驳了“只要生成式模型知道我的品牌,就不需要索引”一类说法。

置信度:高。

8.4 规模、用户数据与 NavBoost

责任判决 ¶¶86–106(裁判书 pp.34–39;PDF pp.38–43)作出以下关键认定:

  • 查询和点击活动是用户意图的强代理,用户与 SERP 的行为可帮助理解结果相关性与网页质量;
  • click data 可能包括点击、是否以及多快返回 SERP、hover、滚动等;
  • 用户数据影响抓取顺序、抓取频率、索引层级、新鲜度、查询改写和排名;
  • NavBoost 把查询与文档配对,通过记忆用户点击数据工作;
  • 它记住用户输入查询后点击哪些文档,以及一个文档对应多个查询的关系;
  • John Giannandrea 的宣誓证词称 NavBoost 被认为 “very important”;
  • 2017 年前用 18 个月数据,之后用 13 个月数据;
  • RankBrain、DeepRank、RankEmbed、RankBERT、MUM 等 generalization systems 用于填补点击数据空白,但没有替代 NavBoost/QBST;
  • 法院称 NavBoost 是 Google core ranking models 之一,并在后续竞争分析中再次采用。

这能支持的最强结论是:聚合、建模后的查询—文档交互数据是 Google 检索与排名体系的重要组成部分;“Google 不使用点击”不成立。

它不能支持:

  • Search Console CTR 是可直接操纵的页面分数;
  • Google Analytics bounce rate 进入 NavBoost;
  • 某个用户快速返回就给页面一个固定负分;
  • 购买点击或诱导点击能获得可持续排名;
  • 13 个月是所有点击系统在 2026 年的统一窗口;
  • goodClicksbadClickslastLongestClicks 可被站长准确反推。

置信度:高(系统和历史用途);低(站长层面的精确映射)。

8.5 为什么点击不能被简化成 CTR

多个内部展品与证词把“直接优化点击”视为危险:

  • UPX0192UPX0219 讨论用户反馈时,强调日志没有显式质量标签、位置本身塑造点击、直接奖励点击会产生 clickbait 或自我强化;
  • Pandu Nayak 的 2025 工程访谈备忘录 PXR0357 写道,Google 避免简单“预测点击”,因为点击易操纵且是改善用户体验的贫弱代理;
  • Paul Haahr 2016 演讲也解释:不点击可能是 snippet 已回答,结果位置会强烈影响点击,实验指标必须结合质量评估与分析。

因此,最准确的模型是:

原始交互日志
  → 清洗、聚合、位置/设备/地点/查询切片与去偏
  → 构造传统信号或训练数据
  → 与相关性、质量、链接、语言模型、反垃圾等共同使用

置信度:高。

8.6 Glue:不仅是蓝链点击表

补救判决(裁判书 pp.153–158;PDF pp.157–162)根据证词认定 Glue 可视为 “super query log”,其底层数据包括:

  1. query 文本、语言、用户地点、设备类型;
  2. 十条蓝链及图片、地图、Knowledge Panel、People Also Ask 等触发的排名/特征;
  3. 点击、hover、SERP duration 等交互;
  4. 拼写纠正、salient terms、interpretations 与 suggestions。

NavBoost 是 Glue 的重要部分;Pandu Nayak 曾把 Glue 描述为包含页面其他特征的 NavBoost。法院反复强调补救只要求共享底层数据,不要求披露由 Glue 构建的模型或信号。

Glue 将蓝链、SERP feature/slot 状态与用户互动共同记录;NavBoost/Glue 相关证据还表明,部分经过处理和聚合的互动数据会用于相关排名系统。但仅凭 Glue 日志包含某个 feature 和某种互动,不能证明该互动被用于触发、选择、排列或评分该 feature,更不能把 Knowledge Panel、PAA 或 AI result 的某次点击转换为站长可计算分数。

置信度:Glue 数据内容及 NavBoost 关系为高;具体 feature 使用方式为未知。

8.7 RankEmbed / RankEmbedBERT

补救判决认定:

  • RankEmbed 及后续 RankEmbedBERT 是依赖搜索日志样本与人类评估分数的 AI/deep-learning ranking models;
  • 模型具有较强自然语言理解和 semantic matching,帮助检索未包含精确词的文档,尤其改善 long-tail 查询;
  • 其训练数据量比早期模型小,但需要重新训练以保持新鲜;
  • 最终补救共享的是训练/构建/运行相关底层 user-side data,不是模型、算法或产生的排名信号。

判决中出现的“70 天日志的一个被涂黑比例”和 PXR0357 中“单月样本”可能指不同模型版本、实验或叙述层,不能强行合并成唯一训练集。

置信度:高(法院认定);未知(2026 当前模型版本/参数)。

8.8 ABC、T*、Q*、P*:哪些只是访谈备忘录

PXR0356 是 2025-02-18 Google 工程师 Hyung-Jin Kim 与专家/律师的电话备忘录;它被作为展品接纳,但不是宣誓证词,也不是录音逐字稿。可谨慎使用的内容:

  • ABC 被概括为 Anchors、Body、Clicks 三类基础原始信号;
  • T* topicality 至少组合这些成分,关注文档与查询的相关性;
  • Q* 被描述为页面质量/可信度,通常较稳定且多与站点相关,但有时受查询影响;
  • PageRank 被描述为与已知优质来源的距离,并作为 Quality 输入;
  • P* popularity 被记为使用 Chrome data;
  • 文档明确承认此前泄露只给出了组件名称,没有 curves 和 thresholds,单凭泄露不足以复现。

安全结论:这些术语说明 Google 内部工程可能把 topicality、quality、popularity 和 NavBoost 等作为不同高层桶组合;它们支持“相关性与质量不是同一件事”“站点相关质量存在”。

不能把它们当成公开公式:

  • ABC 不是完整信号清单;
  • Q* 不是第三方站点权威指标;
  • P* 不能证明 Chrome 的全部用途或当前权重;
  • 备忘录中的 “over 100 raw signals” 不能与泄露 14,062 字段相加或等同;
  • 涂黑部分和上下文缺失使任何权重推导都不可靠。

置信度:中等。

8.9 Chrome 数据:法院故意没有走到的结论

补救判决裁判书 pp.143–144(PDF pp.147–148)是最权威边界:

  • 两份展品“suggest” popularity signal 基于 Chrome visit data 和 anchors,并用于提升链接良好的文档;
  • Chrome visit data 看似一种用户交互数据,但不是通过涉案主要默认分发渠道产生的搜索交互;
  • 原告没有提供证词解释其范围;
  • 法院因此说 “can say no more” 并拒绝强制共享 popularity signal。

故以下两个极端都不成立:

  • “法院证明 ChromeInTotal 是当前通用直接排名因子”;
  • “Chrome 数据绝不可能用于任何搜索质量/流行度系统”。

准确状态是:展品提供了存在性暗示,法院确认记录不足以界定范围。置信度:中等(历史使用迹象);未知(当前覆盖、定义和权重)。

8.10 AI grounding、FastSearch 与 MAGIT

补救判决对生成式搜索给出的强证据:

  • grounding/RAG 通常把用户 prompt 变成搜索查询,访问 search/index,取得结果,再交给 LLM 生成回答;
  • 搜索 API、索引和 ranking 的质量会影响生成式回答与引用;
  • FastSearch 基于 RankEmbed,返回更少或更简化的已排名文档,以换取速度,但质量低于 full Search;
  • PXR0357 称 FastSearch 用作 Vertex AI 与 Gemini app 的 RAG grounding;
  • Google Search 团队会对 Gemini base model 做 search-specific post-training;MAGIT 用于把基础模型微调为 AI Overviews 所需输出格式;
  • 记录只说 MAGIT 使用 “Search data”,没有证明其具体类型、数量和重要性。

法院还认定:

  • Gemini base model 的 pre-training 不使用 click/query logs;
  • Google 曾考虑这样做,但认为收益不抵成本;
  • 这不等于 Search-specific post-training 不使用任何搜索数据;
  • 原告没有证明 Google 的 Search 规模必然让其 GenAI 回答优于所有竞争者。

因此不能写“Gemini 完全不用搜索交互数据”,也不能写“AI Overviews 全部由点击日志训练”。

置信度:高。

8.11 Final Judgment 到底要求公开什么

最终判决 ECF 1462 §IV 要求向符合资格的竞争者,在隐私与安全措施下提供有限信息:

  • 对索引中的每个文档:DocID、重复文档标记、DocID—URL map;
  • 首次看到时间、最后抓取时间、spam score、device-type flag;
  • 用于构建/创建/运行 Glue statistical models 的 user-side data;
  • 用于训练/构建/运行 RankEmbed models 的 user-side data。

§IV.B 明确排除:algorithms、ranking signals、post-trained LLMs 等知识产权和商业秘密。 搜索 syndication 也只面向 Qualified Competitors,并非向公众开放 Google 完整排名系统。

所以“DOJ/法院强迫 Google 公开了搜索算法”是错误说法。

置信度:高。

8.12 DOJ 证据对 SEO/GEO 的真正意义

可以可靠纳入执行框架的只有:

  • 索引完整性、查询理解、候选检索、质量与交互是相互独立又组合的层;
  • 用户数据在抓取、索引、查询理解、排名、SERP feature 和模型训练中可能扮演不同角色;
  • 在已披露的若干系统中,用户交互会被聚合、分片、归一化或进行位置偏差校正;站长可见的原始 CTR、停留时间、跳出率或单次点击不能直接替代 Google 内部信号;
  • 语言模型补充而非自动消灭传统检索信号;
  • 生成式回答质量依赖检索/index/ranking foundation;
  • Google 对 curves、thresholds、模型和生产信号仍然保密。

不能从案件获得:当前完整因子清单、权重、单站分数、可复制的点击阈值、AI citation formula 或确保排名的方法。


9. Google 搜索与生成式搜索专利:22 组代表性证据

9.1 专利的正确用法

Google Patents 每页都说明法律状态是推定信息而非法律结论。本文把专利作为三种证据使用:

  • Google/相关受让人曾在特定日期披露并申请保护一种机制;
  • 该机制的输入、处理步骤和输出在说明书或权利要求中有具体表达;
  • 多个专利可以展示技术思想的演进。

专利不证明:生产部署、当前运行、所有查询适用、说明书所有可选特征均采用、示例参数是生产参数、当前权重,或网站复现输入就会获得排名/引用。

9.2 22 组专利矩阵

# 专利 Google Patents 状态 披露的核心机制 最强可支持结论 主要边界
1 US6285999B1 — Method for node ranking in a linked database Expired - Lifetime 以链接图迭代计算文档重要性;随机浏览者/跳转;可与文本与锚文本组合 Google 的基础技术历史上明确包含查询无关链接重要性 不是当前原始 PageRank 公式或权重
2 US8117209B1 — Ranking documents based on user behavior and/or feature data Expired - Fee Related 以链接被选择/未选择和链接特征训练模型,分配不同权重 链接的上下文、位置和被选择倾向可比裸数量更有意义 不证明当前链接位置权重或点击外链直接加分
3 US9165040B1 / US9953049B1 — seed distance Active(主记录) 从优质种子计算链接图距离并用于评分/排名 链接质量可表现为来源与图路径而非数量 不证明 TrustRank 名称、种子名单或固定跳数
4 US7509344B1 — Detecting link spam Expired - Lifetime 从链接图数学性质识别人为重要性膨胀 Google 很早就研究图级 link spam 不给出当前阈值或系统状态
5 US9002832B1 — Classifying sites as low quality Active 以入链来源质量组、独立性与 boilerplate 去重计算站点 link-quality 来源质量分布和独立性可能比链接总数重要 分组、权重、阈值不是生产参数
6 US7260573B1 — Personalizing anchor text scores Expired - Lifetime 锚文本与来源页面重要性共同影响目标文档分 锚文本可提供目标正文外的描述 不支持完全匹配锚文本越多越好
7 US7536408B2 / US9990421B2 — Phrase indexing/search Expired - Lifetime 用短语共现与信息增益识别相关短语、主题并检索 主题相关性不等于重复查询词 不是第三方“LSI/语义词”工具的验证
8 US8078629B2 — Phrase-based spam Active 实际相关短语异常高于正常预期时识别 spam 自然主题覆盖与机械堆词可被区分 无公开安全密度/阈值
9 US7346839B2 — Historical data Expired - Lifetime 建模文档、内容、链接、查询、流量、域名等历史变化 新鲜度依查询而异;自然与异常增长可区分 权利要求列表不是现行因子表
10 US7627613B1 — Duplicate document detection Expired - Fee Related fingerprint、equivalence class、代表文档、信号归并 重复的主要技术问题是聚类、代表 URL 和信号整合 不证明当前只按 PageRank 选 canonical
11 US8442984B1 — Website quality signal generation Active 以人工整站质量评分训练自动模型 人评可训练/评估模型,而非直接逐站排位 不证明当前 rater 单次评分影响页面
12 US9195944B1 — Scoring site quality Active 聚合点击到返回 SERP 的时长,去极值/异常并形成站点分 Google 申请过复杂的 click-to-return 站点质量机制 不等于 GA bounce/dwell time 直接排名
13 US9760641B1 — Site quality score Active 指向站点的 unique queries 与站点相关 query 集合的比例 主动寻找站点的需求与广泛查询覆盖可分别建模 不能简化成“刷品牌搜索”
14 US8682892B1 — Ranking search results Expired - Fee Related 独立入链 + reference queries 形成站点级修正 外部独立认可和导航需求可被组合 不证明无链接 mention 当前直接传值
15 US8661029B1 / US8938463B1 — Implicit feedback Active(主记录) 查询—文档点击、访问时长、long/total click、位置/展示偏差校正 用户反馈机制可以复杂去偏,绝非裸 CTR 专利单独不证明 NavBoost/Glue 当前实现
16 US8046371B2 — Local prominence Expired - Lifetime 在相关性/距离外,结合文档提及、评论与现实 prominence 本地排序不只看距离 不能分配当前评论/路线请求权重
17 US10235423B2 — Entity metrics Active 以知识图谱实体、类型与指标加权排序 实体理解可超越字符串匹配 schema/Knowledge Panel 不保证网页加分
18 US9940367B1 — Candidate answer passages Active 从已排序资源生成并评分候选答案段落 文档相关性与段落回答性是不同层 不给出固定 top-N 或最佳段落长度
19 US9959315B1 — Context scoring for answer passages Active 标题路径、局部上下文、coverage、列表等调节答案分 清晰结构可帮助段落级理解/抽取 H2/H3/列表没有通用固定权重
20 US11093813B2 — Answer to question neural networks Active encoder/attention 建模问题与段落匹配 可单独评价段落回答问题的程度 不等同已确认的 BERT passage production model
21 US11003865B1 — Retrieval-augmented LM Active 联合训练 retriever 与 language model;开放域问答先检索再生成 被检索与被模型使用是不同阶段 不证明当前 Google Search/AI Overview 采用此实现
22 US11769017B1 — Generative summaries for search results Active 查询 + 响应文档 + 相关/隐含查询 → LLM 摘要、置信度、可验证部分与来源链接 Google 获得过与生成式搜索高度相关的完整专利家族 不能等同当前 AI Overview 全部实现或引用公式

9.3 专利串联出的技术演进

仅根据专利原文,可构造以下分析性层次:

  1. 抓取、索引与规范化: 短语索引、重复聚类、代表 URL、垃圾识别;
  2. 查询理解与召回: 查询词、短语、锚文本、相关短语、实体、相关/隐含查询;
  3. 基础排序: 链接图、链接权重、种子距离、历史数据、本地 prominence、实体指标、站点级分数;
  4. 质量与行为修正: 入链质量分布、人评监督模型、访问时长、查询—文档选择、展示偏差与异常过滤;
  5. 答案段落: 从已排序资源生成候选段落,结合局部结构与神经匹配评分;
  6. 生成式摘要: 选择搜索/检索候选,生成摘要,评估置信与可验证性,链接支持文档。

这不是 Google 发布的统一架构图,而是对 22 个专利家族的分析性分层。它与当前官方 GEO 指南的核心关系一致:传统发现、索引、查询理解、质量和排名位于上游,生成式综合位于其上。

9.4 最相关的生成式专利:US11769017B1

该家族优先权日为 2022-12-30,2023-09-26 授权。核心权利要求覆盖:

  • 接收查询和响应查询的文档内容;
  • 把查询与文档交给 LLM 生成自然语言摘要;
  • 显示对应文档的可选择链接;
  • 可同时选择响应原查询与 correlated related query 的文档;
  • 可按 query-dependent、query-independent 与 user-dependent 特征选择候选;
  • 计算 confidence measure;
  • 识别摘要中可验证的部分并给出对应文档链接;
  • 处理 implied query。

它是目前最直接的 Google 生成式搜索技术披露,但仍缺失生产模型、prompt、fan-out 数量、候选集、阈值、市场覆盖和实时权重。把它称为“AI Overview 专利”尚可作为通俗指代,但称为“当前 AI Overview 完整算法”则不准确。

置信度:高(专利内容);低至中等(与 2026 产品逐项映射)。


10. 2024 Google Content Warehouse 泄露文档:可采信证据与严格边界

10.1 来源链与可复核事实

原始可复核来源:

对固定 Git tree 独立计数:

快照 Content Warehouse 文件 模型文件 field(...) 声明 Discovery revision
d7a637f4,2024-03-13 2,596 2,587 14,062 20231106
3bbe9aea,2024-03-27 2,602 2,593 14,031 20240321
30030fba,2024-04-16 2,604 2,595 14,214 20240412
ecfc6bb2,2024-05-07 183 174 594 20240506

2024-05-07 快照相对前一完整快照大幅缩减,只能证明公开 Discovery API surface 变化;不能证明相关内部系统被删除、停止生产或有人“销毁证据”。

因此最精确的说法是“14,062 条字段定义”,不是“14,062 个排名因子”。模块还混合 Search、Assistant、People、Shopping、Abuse、Video、Cloud 等多个产品/存储结构。

10.2 Google 的回应与来源链

Google 发给媒体的声明要点是:不要根据脱离上下文、过时或不完整的信息对 Search 作不准确推断;Google 已公开大量关于 Search 工作方式和系统所权衡因素的信息,同时需要保护结果免受操纵。

这份回应与原始仓库证据共同支持两点:

  1. Google 就该材料作出回应且未在声明中否认其来源;材料的来源真实性还受到 Google 所有的 googleapis 仓库固定 commit、提交历史、Google 自动化生成标记与生成物链条支持。媒体把这份声明报道为真实性确认,但该媒体定性本身仍是二手传播语境;
  2. Google 没有确认每个字段的生产状态、用途、权重或当前性,反而明确警告这些维度不完整。

本文因此把泄露定为 L 级内部 schema 快照,不把 Google 对泄露材料的回应及其未否认来源这一事实扩大成“Google 确认所有字段都参与排名”。

置信度:高。

10.3 为什么 schema 不是算法调用图

自动生成 API 文档通常能告诉我们:

  • protobuf/message/module 名称;
  • 字段名称与类型;
  • 部分开发者注释;
  • deprecated、experimental、serving、shard、index、join 等状态提示;
  • 某些内部代码路径或团队名。

但它通常不能告诉我们:

  • 谁在何时读取字段;
  • 是否在生产、实验、离线评估、调试、索引构建或已废弃路径;
  • 读取后作为召回、排序、反垃圾、抓取、展示、训练还是监控输入;
  • feature flag、国家/语言/垂类/查询切片;
  • 权重、归一化、阈值、组合函数和重排顺序;
  • 2024 后的替换与 2026 当前状态。

泄露自身就提供反例:

  • CompositeDocQualitySignals 注释说其名称自 2022-10-14 起具有误导性,字段仍有数据但不再包含 quality signals,全部是 freshness;
  • CompressedQualitySignals 中多个 experimental 字段明确写着“不传播到 shards”“只用于 live experiments”“不应用于 launches”;
  • AnchorsAnchor.experimental 写明为 true 时只用于实验,不应在 serving 使用;
  • 一些字段明确 DEPRECATEDDO NOT USE 或仅存在于 legacy protos。

所以,“字段名看起来像排名因素”是最低级的存在性线索,而不是生产用途证明。

10.4 代表性模块/字段证据矩阵

以下链接直接指向固定提交中的原始生成文件。

模块/字段 原始注释能支持什么 不能支持什么 与其他证据的关系
QualityNavboostCrapsCrapsClickSignalsclicksgoodClicksbadClickslastLongestClicksunsquashed* NavBoost/Craps schema 存在多种聚合点击与 impression 表示,并有格式迁移 “good/bad”的业务定义、权重、当前使用、单次点击含义 法院确认 NavBoost 记忆 query-click data,交叉后置信度高
QualityNavboostCrapsCrapsData:device、mobile、aging、pattern、IP prior 交互数据按设备/移动/模式等切片,并关联 freshness aging 和 prior 普通站长能从 CTR 反推分数 与 Glue/DOJ 的设备、地点、查询切片概念一致
CompressedQualitySignalssiteAuthorityunauthoritativeScorescamnesslowQualityexactMatchDomainDemotionpandaDemotionanchorMismatchDemotion 压缩质量结构中存在站点权威、非权威、诈骗、低质与多类降权字段;注释称部分用于 Qstar 这些字段全部同时上线、当前权重、等同 E-E-A-T/DA/DR PXR0356 的 Q* 和官方 site-wide signals 提供交叉支持;具体字段状态仍未知
PerDocData:PageRank、SpamBrain、hostNsrOriginalContentScorehostAge、semantic dates、last significant update、content attributions 单文档存储/服务结构容纳链接、垃圾、站点、新鲜度、原创性、归因等多类数据;某些字段注释明确用途 每个字段都进入最终排名;hostAge 是域名年龄加分;作者 ID 是作者排名 官方公开 PageRank、SpamBrain、freshness、original content;hostAge 注释实际指向 fresh-spam sandbox 而非年龄奖励
QualityNsrNsrDatachromeInTotalsmallPersonalSiteisElectionAuthorityisCovidLocalAuthorityugcScore 存在 site-level Chrome views、个人小站 promotion score、特定权威位与 UGC score 字段 Chrome views 是通用直接排名;所有小站自动提升;authority 位适用于所有主题 法院只确认 P* Chrome 证据不充分;特定权威字段与 YMYL/reliable information 方向一致但不能扩大
QualityAuthorityTopicEmbeddingsVersionedItem:page/site embedding、site focus、site radius 页面/站点主题表示、专注程度与偏离半径可存在于 versioned data 站点只能写单一主题;第三方 embedding 能预测排名 与 RankEmbed/官方语义系统方向一致,但模块具体 production 状态未知
ContentAttributions 注释明确说存储页面对另一页面的内容归因,并在 ranking 中提升被归因页面 复制后加 canonical/链接必然转移排名;所有原创检测都用它 与官方 Original content systems 强交叉,机制细节仍不完整
AnchorsAnchor:source quality type、PageRank weight、locality、bucket、context、firstseen 锚文本记录可包含来源质量、PageRank 权重、locality、上下文、历史和 canonical forwarding 页脚/导航/正文存在固定公开权重;字段都在 serving 与 PageRank、reasonable surfer、link spam 专利交叉,仍无当前权重
CompositeDocQualitySignals 名称已过时;实际数据只与 freshness 有关 仅凭模块名判断质量用途 直接证明字段命名不可当作算法语义
RepositoryWebrefPerDocRelevanceRating 存在逐文档 relevance rating 数据结构 rating 来自哪类人、是否直接排位、当前用途 需由 QRG/庭审的人评证据补充,单字段不能说明

10.4.1 其他常被误读的字段

以下采用较新的完整快照 30030fba1b51dc065242318bc2a9896a0e61f55b 固定引用:

字段/模块 文档明示 正确结论 错误外推
contentEffort in QualityNsrPQData 面向文章页、由 LLM 估算内容创作投入程度的 versioned signals 相关字段/模型概念存在过,且定义可能版本化变化 Google 能准确知道写作小时数;人工必高、AI 必低;越长越高
titlematchScore, site2vec*, siteLinkIn/Out, clutterScore in NSR 站点标题—查询匹配、站点 embedding、链接流与页面杂乱等表示 Google 内部站点表示维度丰富 在标题堆词、追第三方 link score、机械单主题化能复现
rawNavboost, normalizedClickScore, selectionTierRank in CompositeDocIndexingInfo canonical/重复聚合前 NavBoost 计数、层级内选择信息 点击数据也可能进入 URL 聚合或索引表示 selection tier 就是最终 SERP rank;点击是唯一 canonical 因子
QualityTimebasedSyntacticDate 区分 trustSyntacticDateInRankinguseAsBylineDate 排名可信日期和结果展示日期可分开 改可见日期/structured data 即刷新排名新鲜度
RepositoryWebrefDetailedEntityScoresWebrefMustangAttachment isAuthorisPublisher、profile URL、entity MID、topicality/relevance 等 Google 文档表示可识别作者/发布者实体,尤其有新闻/科研语境 存在通用作者权威分;Author schema/Google Profile 直接加分
AnchorsAnchorSourceAnchorStatistics 来源 PageRank/NSR/spam、同站/同域/站外、first-seen、penalty、聚合统计 链接评估远多于“反链数” 某个锚文本比例、DR 阈值或字体位置配方
DocProperties avgTermWeight、加权字体、文档属性 解析/索引会保留显著性和结构信息 把关键词放大、加粗或多用 H1 能直接加分

作者实体识别、内容来源归因、站点 authority、Q* 与 E-E-A-T 是不同概念。把它们合并成一个虚构的“作者/网站 E-E-A-T 分数”没有一手证据。

10.5 交叉确认后的证据强度

命题 泄露 独立一手证据 综合判断
NavBoost/点击数据参与 query-document 系统 多个 Craps/NavBoost 结构 责任/补救判决、Lehman/Nayak/Giannandrea 证词
点击不是裸 CTR good/bad/longest、设备、squashed/unsquashed、prior 等结构 PXR0357、UPX0192/0219、Paul Haahr
PageRank/链接仍存在 多个 PageRank、anchor 字段 当前 Ranking Systems Guide、法院、专利
站点级质量/权威结构存在 siteAuthority、hostNsr、Qstar 注释 官方 site-wide signals;PXR0356 Q* 中高
原创内容/归因被建模 OriginalContentScore、ContentAttributions 官方 Original content systems 中高;具体字段当前状态未知
freshness 是多字段、多来源问题 semanticDate、LSU、freshbox、aging 官方 freshness systems、crawl docs
Chrome views 被某内部结构记录 chromeInTotal;PXR0356 P* 法院说展品 suggest,但证词不足 中等存在性;当前排名用途未知
域名/host 年龄直接提升排名 hostAge 存在 注释说用于 fresh spam sandbox;无官方年龄加分 不支持;置信度高
作者 ID/作者简介是通用直接排名因子 有 author/GAIA 等字段,但跨多个产品 无当前官方通用作者分确认 不支持;未知
14,062 个排名因子 14,062 个字段定义 明确错误;置信度高

10.6 泄露是否证明 Google “撒谎”

不能一概而论。必须逐条拿“Google 在什么日期、由谁、用什么精确措辞否定了什么”对照“泄露字段实际注释”。常见偷换包括:

  • Google 说 E-E-A-T 不是单一具体排名因子;泄露有 siteAuthority。两者不矛盾,因为 siteAuthority 不等于 E-E-A-T,且官方从未否认站点范围信号存在。
  • Google 员工过去可能说“domain age 不重要”;泄露有 hostAge。注释明确用途是 fresh spam sandbox,不是老域名奖励。
  • Google 对 Chrome 数据的公开解释常被概括为“完全不用”;泄露与 PXR 显示某些结构含 Chrome data,但法院明确认定用途范围证据不足。
  • Google 说 quality raters 不直接排页面;泄露/专利有 rating 与人评训练结构。这恰好与“用于评估或训练,而非人工直接排位”一致。

最强、最诚实的结论是:Google 的公众沟通刻意保持概念级和防操纵边界,不能当作内部字段字典;泄露揭示了大量公众材料没有描述的内部命名和数据结构,也暴露了语义差距,但不构成 Google 所有公开说法为假的证据。

10.7 对 SEO/GEO 真正有用的泄露结论

泄露没有产生一套可信的新教程。它最有价值的贡献是让以下官方原则更具体:

  • Search 是由大量分层数据结构、传统信号、模型和重排组成,不是单因子公式;
  • query relevance、page/site quality、links、user interaction、freshness、spam、originality 与 attribution 是可分开的工程问题;
  • 同一字段可能是 deprecated、experimental、debug、offline、serving-only 或 launch-excluded;
  • 站点范围概念存在,但不能映射到第三方 authority score;
  • 生成式搜索仍依赖上游索引和检索质量;
  • curves、thresholds、权重和完整调用图仍然没有泄露。

这也说明任何声称“根据泄露给出精确权重、CTR 阈值、站点权威算法或 AI citation formula”的教程,都超出了原始证据。


11. Google 内部人员的一手公开发言

这些材料的用途是解释机制、历史和设计目标。只要当前正式文档已更新,正式文档优先。

人员与原始来源 日期 可采信命题 必须保留的限制 证据/置信度
Gary Illyes — Inside Googlebot 2026-03-31 中央抓取平台;Googlebot 2 MB、PDF 64 MB;子资源各自限制;WRS 无状态 当前技术仍可能将来变化 G2 / 高
Martin Splitt、Gary Illyes — Crawling December resources 2024-12-03 原始服务器 access logs 最能说明真实抓取,Crawl Stats 次之;阻断资源妨碍理解 具体数值以当前 crawler 文档为准 G2 / 高
Martin Splitt — Introducing INP 2023-05-10;2024-03 更新 INP 替代 FID;CWV 重要但不保证排名 当前 page-experience 文档优先 G2 / 高
John Mueller — Succeeding in AI search 2025-05-21 独特非商品化内容、可访问性、体验、多模态、预览控制 2026-07-10 GEO 指南是更完整现行版 G2 / 高
John Mueller — New generative AI resource 2026-05-15 发布 Google 正式 GEO 指南,强调延续 SEO 基础 以指南正文为最高来源 G2 / 高
John Mueller、Nir Kalush — Mobile-first indexing has landed 2023-10-31 Mobile-first rollout 基本完成,移动版必须完整 当前 mobile-first 文档优先 G2 / 高
John Mueller — Reunifying duplicate content 2009-10 站内重复通常不是处罚;robots 隐藏重复会妨碍 Google 识别关系 很多旧工具/流程已变化,只作历史解释 G2 历史 / 中高
Danny Sullivan — Core updates 2019-08-01 广泛更新不是针对某站;下降不自动等于违规;rater 不直接排名 当前 core-update 文档已补充诊断时序 G2 / 高
Danny Sullivan、Gary Illyes — Evolving nofollow 2019-09-10 nofollow/ugc/sponsored 作为 hint;付费链接应标记 当前 outbound-link 文档优先 G2 / 高
Danny Sullivan、Chris Nelson — AI-generated content 2023-02-08 AI 本身不违规,操纵排名才是问题 当前 scaled content abuse 措辞更准确 G2 / 高
Pandu Nayak — How AI powers Search 2022-02-03 RankBrain 理解概念;BERT 与其他系统协作;MUM 多任务能力 当前 ranking guide 说明 MUM 不用于 general ranking G2 / 高
Paul Haahr — How Google Works: A Google Ranking Engineer's Story 2016-03 查询理解、分片召回、query-document scoring、中央合并、去重/多样性/垃圾重排;变更经实验评审 历史“十条蓝链”架构,不能当 2026 完整系统 E / 中高
Paul Haahr、Gary Illyes — SMX Q&A 原始录像 2016-03 点击实验受摘要、位置等强烈混淆;rater 的 Needs Met/Page Quality 是评估目标 不能据此说 CTR 是直接因子,也不能说 Google 完全不用点击 E / 中高

11.1 Paul Haahr 2016 演讲的正确读法

历史架构大致为:

  1. 查询理解;
  2. 查询发送至 index shards;
  3. shard 内计算查询—文档匹配分;
  4. 各 shard 返回顶部候选;
  5. 中央合并;
  6. 站点多样性、重复和垃圾等后处理;
  7. 生成摘要并与其他搜索功能组合。

他还把变更评价区分为实时 A/B/点击模式与人类质量评估,并花大量时间说明点击混淆。因此唯一安全结论是:Google 使用点击行为评价实验;该演讲本身既不证明普通 CTR 是直接生产排名因子,也不证明 Google 完全不使用点击作为排名/训练数据。 后来的 DOJ 证据提供了 NavBoost/Glue 的更强确认。

11.2 员工发言与正式规范冲突时怎么办

按以下顺序处理:

  1. 检查发言日期和原始上下文;
  2. 区分“Google 不使用”“不是直接因子”“不是唯一因子”“不值得站长优化”“无法保证”这些不同命题;
  3. 查看当前 Search Central 文档是否已经改写;
  4. 查看法院/专利/泄露是否只是揭示不同层级,例如训练数据、实验指标或 schema 字段;
  5. 当前规范优先;历史发言用于说明当时背景,不用来否定明确更新。

12. 历史演进与容易误用的过时口径

主题 旧口径 截至 2026-07-13 的当前口径
Webmaster Guidelines 旧名称 2022 后为 Search Essentials
AI/自动内容 常被概括为自动生成即违规 判断 scaled content abuse,不论生产方法
Helpful Content 2022 独立 system/site classifier 2024-03 并入核心排名系统
Panda / Penguin 独立可观察更新 2015 / 2016 分别并入核心系统
Mobile-first 分批迁移 2023-10 宣布迁移基本完成
Core Web Vitals FID 2024-03-12 起 INP 取代 FID
Dynamic rendering 曾是官方解决办法 只是 workaround,优先 SSR/静态/hydration
nofollow 接近指令 排名自 2019、抓取/索引自 2020 起为 hint
Googlebot 文件上限 2022 官方文章写 15 MB 当前普通 URL 2 MB;PDF 64 MB
Google News 容易被理解为 Publisher Center 手工纳入 内容自动被考虑;2025-03 起 publication pages 自动化
AI Search 报告 2025 只计入总体 Web performance 2026-06 部分 property 新增独立 Search/Discover GenAI report
AI Search 退出 主要依赖 preview controls 2026 新增 Search Console property-level Include/Exclude
GEO 要求 2025 说无特殊优化 2026-07-10 仍以 SEO 为底座,并正式否定 llms.txt/chunking 等
Structured data 常被社区当排名技巧 用于理解与 rich-result 资格,不保证展示或通用排名提升
E-E-A-T 常被包装成数值因子 不是单一具体排名因子
Quality raters 常被误解为人工直接排站 评估系统,不能控制单页排名

13. 常见 SEO/GEO 主张的证据裁决

主张 裁决 最强一手证据 置信度
满足技术要求就一定收录 错;只有资格 Technical requirements / How Search Works
付费给 Google 可提高自然排名 Search Essentials / Do you need an SEO
有一个公开公式可保证第一 SEO Starter Guide / 第三方建议指南
meta keywords 有排名价值 Google 不使用 SEO Starter Guide
meta description 直接加排名分 不受支持;主要是 snippet 候选 Snippets / Starter Guide
每页只能有一个 H1 无此官方排名规则 Starter Guide
heading 顺序错误会被处罚 无此规则;清晰结构仍有可用性价值 Starter Guide
固定文章字数更受偏好 错;没有理想长度 Helpful content / 2026 AI guide
精确关键词必须逐字出现 错;语义系统理解概念和同义词 Ranking systems / AI guide
每个长尾词应建一页 错;可能演变为 scaled content abuse AI guide / Spam policies
精确匹配域名自动有优势 不成立;有 EMD adjustment 防止过度信用 Ranking systems
TLD 本身提供强通用排名优势 不受支持;主要可能与地区理解有关 Starter Guide / international docs
子域一定比目录好,或反之 Google 没给通用排名答案,按业务维护选择 Starter Guide
duplicate content 自动处罚 通常错误;主要是去重/canonical Canonical docs / John Mueller 2009
canonical 是绝对命令 错;强提示,Google 可另选 Canonical docs
sitemap 是收录命令 错;只是提示 Sitemap docs
robots.txt 可删除索引 Robots docs
robots.txt 可保护秘密内容 Robots docs
nofollow 保证不抓取/不传递任何理解 错;当前是 hint Nofollow announcement/docs
Structured data 直接提升普通排名 官方没有此承诺 Structured data intro/policies
正确 schema 保证 rich result Structured data policies
AI 搜索需要专用 schema 错;不存在 2026 AI guide
Core Web Vitals 满分保证排名 Page experience / CWV
HTTPS/移动友好单独保证高排名 Page experience
JavaScript 内容 Google 看不到 过度;能处理,但有队列/阻断/稳定性边界 JS SEO docs
SSR 没有任何 SEO/可用性价值 错;仍有速度、稳定性与兼容优势 JS SEO docs
Googlebot 当前处理 15 MB HTML 过时;当前普通 URL 2 MB、PDF 64 MB Googlebot 2026 docs
404 比 410 永远慢很多 Google 对核心处理无本质差异 HTTP status docs
E-E-A-T 是一个可查的单一分数 Helpful content / QRG
作者简介本身直接加 E-E-A-T 分 不受支持;真实透明度可帮助用户判断 Helpful content / QRG
Quality raters 直接调页面排名 Helpful content / QRG / DOJ
AI 写的内容天然违规 AI content guidance / Spam policies
人工写的批量低价值内容就安全 错;scaled abuse 不看生产方法 Spam policies
改发布日期可获得 freshness 错;无实质变化无效 Helpful content;泄露 LSU/date 结构
老域名自动排名更高 不受支持;hostAge 注释偏反垃圾 Official docs + leak 高(否定捷径)
PageRank 已经完全不用 Ranking systems / DOJ / leak
反链数量就是链接价值 Official links/PageRank + patents + leak
DA/DR 等于 Google siteAuthority 错;没有映射 Google third-party guidance + leak boundary
Google 完全不使用点击 Liability/remedies opinions / NavBoost
单页 CTR 是直接线性排名因子 不受支持;点击被去偏、聚合、建模 DOJ exhibits/testimony/patents
GA bounce rate 进入 Google 排名 无一手证据 DOJ/leak边界;Analytics 与 Search 数据分离 高(无证据)
刷点击能稳定提高排名 不受支持且忽略反作弊/去偏 PXR0357 / UPX exhibits
Chrome 浏览量已被法院确认直接排名 错;法院说证据不足以界定 Remedies opinion pp.143–144
泄露包含 14,000 个排名因子 错;约 14,000 schema fields Official Git tree
泄露给出了权重和阈值 Schema + PXR0356
siteFocusScore 证明网站只能做一个主题 错;字段存在不等于普遍规则 Leak schema
contentEffort 证明人工/长文必胜 错;versioned field,生产状态未知 Leak schema
OriginalContentScore 是所有页面原创度 错;注释限定少内容页面 Leak schema
作者 entity 字段就是作者权威排名分 Leak schema boundary
llms.txt 提高 Google AI 可见性 错;Google Search 忽略,不伤不助 2026 AI guide
必须把内容切成小 chunks 2026 AI guide
必须写 AI 专用句法 2026 AI guide
制造大量品牌 mentions 有助 AI Google 明确否定非真实 mentions 2026 AI guide
AI Overview 引用就是传统排名前 N 无证据 AI guide / patents / DOJ 未知
自然排名第一必然获 AI 引用 无保证 AI guide 高(否定保证)
专利就是当前算法 专利证据边界
US11769017B1 是 AI Overview 完整源码 错;只是专利家族 专利原文
Search Console 提供完整引用/查询数据 错;GenAI report 维度有限 Search Console help
Search Console average position 是固定真实排名 错;是聚合后的最高位置平均 Search Console docs
Search AI Exclude 会降低普通网页排名 官方说不会 Search Console AI control
Google-Extended 等同 Search AI Exclude 错;产品范围不同 Crawler docs / Search Console control

这张表的核心规则:凡是 Google 只承诺 eligibility、hint、may、systems/signals 或 no guarantee,就不能在下一行被营销文案改写成直接加分、固定公式或保证。


14. 只依据一手证据建立的 SEO/GEO 执行框架

这不是“秘籍清单”。它把官方要求按系统依赖排序:先解决候选资格,再解决内容价值和可理解性,最后才是展示、生成式引用与测量。每层都给出可验证验收条件。

证据层级说明:以下为本文的 X 级操作框架。 它只使用前文一手证据作为约束和依据,但层级排序、具体动作、验收条件、复核周期与组织流程均为本文综合推导,并非 Google、法院、专利权人或 Google 员工发布的统一执行清单。凡属官方直接要求之处,另附原始来源。

第 0 层:证据治理

目标: 防止团队把传闻、工具指标和历史说法写成事实。

动作:

  • 建立“主张—原始来源—日期—证据层级—可支持结论—边界—置信度”登记表;
  • 当前 Google 正式文档覆盖旧员工发言;法院认定覆盖当事方主张;专利/泄露永远保留部署边界;
  • 第三方工具数据只用于工作流或观察,不作为 Google 内部机制证明;
  • 重要策略每季度或在 Google 文档更新时复核;
  • 不把字段数、相关性或案例成功率写成排名因子数量/因果关系。

验收: 每个影响产品、内容或工程的 SEO/GEO 要求都能回到原始链接;无来源的要求被标成假设并设计验证,而不是伪装成 Google 规则。

第 1 层:Search 资格

目标: 让应公开的页面具备进入普通 Search 与 Search GenAI 的最低资格。

动作:

  • Googlebot 可访问;
  • 返回真实 200,不存在的页面返回 404/410;
  • 页面有可索引主内容;
  • 没有误加 noindex、认证墙或 robots 阻断;
  • 遵守 spam policies;
  • 生成式功能另检查 Search Console property 的 Include/Exclude 状态;
  • 需要 snippet/grounding 的内容没有被 nosnippet 或过严 max-snippet 排除。

验收: URL Inspection、服务器响应、robots/noindex 和 rendered HTML 一致;关键页面不是 soft 404;Search Console 无大规模误排除。

非目标: 通过这一层不代表已索引、已排名或已被 AI 引用。

第 2 层:发现与抓取效率

目标: 让 Google 能发现重要 URL,把抓取资源花在有价值页面。

动作:

  • 重要页由可抓取 <a href> 内链到达;
  • sitemap 只列 canonical、返回 200 且希望索引的 URL;
  • 准确维护 lastmod,不伪造更新;
  • 消除无限参数组合、重复 facet、日历空间、session ID 与重定向链;
  • 大站分析 access logs 与 Crawl Stats;
  • 提升服务器稳定性,处理 5xx、429、DNS/网络错误;
  • 关键内容与 metadata 放在 Googlebot 文件上限之前。

验收: 关键新页可从已知页发现;sitemap 与真实状态/canonical 一致;日志显示 Googlebot 抓取集中于有价值空间;错误率和平均响应可控。

第 3 层:渲染与移动版完整性

目标: 保证 Google 实际看到的内容与用户看到的主内容一致。

动作:

  • 关键正文、title、meta、canonical 和必要结构在初始或稳定可渲染 HTML 中;
  • 关键 CSS/JS 未被阻止;
  • JS 路由可直接访问并返回正确状态;
  • 移动版保留桌面版正文、metadata、structured data、图片/视频和内部链接;
  • 需要登录、cookie、local storage 或交互才显示的内容不承担唯一索引职责;
  • 用 URL Inspection rendered result 与真实移动浏览器交叉检查。

验收: 初始 HTML、渲染 HTML、移动版和 canonical 内容无关键缺失;不存在 JS soft 404、初始 noindex 后删或 canonical 冲突。

第 4 层:索引、去重与 canonical

目标: 让同一内容的信号聚合到预期代表 URL。

动作:

  • 同一内容只保留必要 URL 变体;
  • 301/308、rel=canonical、sitemap 和内链指向一致;
  • 使用自引用 canonical;
  • hreflang 页 canonical 到同语言有效版本;
  • 分页页保留自身 canonical,除非真正重复;
  • 参数、协议、主机、尾斜杠和大小写策略一致;
  • 不用 robots 或 Removals 做 canonical;
  • 站点迁移时保留一对一重定向并持续监控。

验收: Search Console 的 Google-selected canonical 与预期大体一致;重复集不出现明显信号分散;索引页面对应真实有价值 URL。

第 5 层:信息架构、内部链接与语义入口

目标: 让用户和系统理解内容层级、页面关系与重要入口。

动作:

  • 以用户任务组织分类、导航、面包屑和相关页;
  • 锚文本准确描述目标,避免“点这里”和机械 exact-match 泛滥;
  • 关键页不成为孤儿页;
  • 分页、过滤与产品变体有清楚边界;
  • 一页可以覆盖多个紧密相关主题,无需为了每个措辞拆页;
  • heading、段落、列表和表格服务于人类阅读与局部理解;不追 H1 数量/段落长度公式。

验收: 用户能从上级页到达目标;爬虫可沿链接遍历;每个页面有明确主任务且与相邻页面不互相复制。

第 6 层:原创价值、来源与责任主体

目标: 提供不能被低成本复述替代的、可验证的信息。

动作:

  • 明确页面服务的真实受众与任务;
  • 加入第一手测试、数据、观察、方法、样本、案例、照片/视频或专业判断;
  • 区分事实、推论、意见与不确定性;
  • 原始数据给出定义、时间、口径、方法和限制;
  • 引用他人时链接原始来源并加入实质分析;
  • 清楚显示作者/编辑/机构责任与相关资质,只写可核验内容;
  • YMYL 内容采用更强来源、审阅与更新机制;
  • AI 辅助内容完成事实核验、去幻觉、版权/来源检查与人工责任确认;
  • 不通过改日期伪装新鲜。

验收: 删除页面上对其他网页的复述后,仍有明确增量;每个关键主张可追溯;用户完成任务不必继续搜索基础缺口。

第 7 层:查询相关性与搜索展示

目标: 让页面对真实用户需求清楚、准确、可被正确展示。

动作:

  • title 和主标题准确概括页面,不夸张、不堆词;
  • 用户实际使用的核心语言自然出现在标题、正文、链接文字、alt 等显著位置;
  • meta description 准确概括并区分页面;
  • 段落局部自足,定义、步骤、结论和限制不互相矛盾;
  • 结构化数据仅使用受支持类型,与可见内容一致;
  • 图片/视频有上下文、清晰度、alt、thumbnail 和专门观看页;
  • 国际页有正确 hreflang 和清晰单页主语言。

验收: 搜索结果 title/snippet 不频繁因页面混乱而被重写;富媒体/structured data 验证通过;页面完整回答其声明的任务。

第 8 层:链接、引用与真实声誉

目标: 让重要内容在真实网络关系中可发现、可归因并获得独立认可。

动作:

  • 创建值得被引用的原创材料、工具、数据、研究、标准说明或第一手资源;
  • 对外推广给真实相关受众,而不是购买排名承诺;
  • 付费/赞助/UGC 链接正确标记;
  • 监控被黑、垃圾 UGC、站内被滥用目录和第三方内容;
  • 不追逐第三方 DA/DR 当作 Google 指标;
  • 不制造假 mentions、链接网络或品牌搜索;
  • 被转载时使用清楚来源链接、授权和 canonical/技术安排,但不假设单一标记必定解决归因。

验收: 链接和 mentions 来自真实编辑/使用关系;站点没有明显 link spam 或 site reputation abuse;可追踪来源归因。

第 9 层:体验、媒体与业务数据

目标: 让从 Search/AI 到站后的用户快速理解并完成任务。

动作:

  • 优先优化主内容可见性、移动可用性、导航、可访问性和低延迟;
  • 以真实用户数据管理 LCP、INP、CLS,不为分数牺牲功能;
  • 限制侵入式 interstitial、页面杂乱与主内容难辨;
  • 商家使用准确 Business Profile;商品用一致 Merchant Center feed/structured data;
  • 图片、视频、库存、价格、运输、退货和当地信息保持同步;
  • 对 agentic transaction 场景,再评估 DOM、accessibility tree、UCP 与稳定任务流程。

验收: 用户能在移动端完成关键任务;业务/商品/本地数据跨页面和 Google feed 一致;CWV 达到合理良好分位但不作为唯一 KPI。

第 10 层:GEO 的“可引用证据单元”

目标: 让 Search grounding 能检索到清楚、非商品化、支持具体主张的材料。

这一层不是 Google 给出的固定引用格式,而是由官方 RAG/grounding、非商品化内容和段落理解机制推导的工程组织方式(X 级推论):

每个重要主题尽量包含:

  1. 明确问题/主张: 到底在回答什么;
  2. 直接结论: 不把答案藏在营销铺垫后;
  3. 证据: 数据、样本、方法、原始来源、第一手经验;
  4. 适用条件: 国家、时间、版本、对象、假设;
  5. 限制/反例: 什么时候不成立;
  6. 更新与责任: 日期、作者/团队、修订记录;
  7. 稳定 URL: 可索引、可引用、canonical 清楚;
  8. 必要媒体: 图表、截图、视频或产品数据与文本一致。

验收: 单独截取重要段落仍能理解主张、证据与条件;引用者不需要猜测数字口径;页面不为 fan-out 变体批量复制。

第 11 层:控制与测量

目标: 分清发现、索引、普通 Search、Search GenAI 与站后结果。

动作:

  • Search Console:索引覆盖、canonical、查询/页面表现、普通 Web 与 GenAI report;
  • access logs:真实 Googlebot 抓取;
  • Analytics:到站后的参与、转化和业务价值;
  • Search Status Dashboard:核心/垃圾更新时点;
  • Trends 与业务数据:区分需求变化、季节性和排名变化;
  • GenAI report 只使用其实际提供的 impressions/pages/country/device/date,不伪造 citation rank;
  • Search AI control、preview controls、Google-Extended 分开记录;
  • 变更前定义基线、受影响 URL、预期机制和观察窗口。

验收: 每次下降都能先判断是需求、抓取、索引、展示、点击还是转化问题;普通 Search 与 GenAI 数据不混淆;报告明确数据限制。

第 12 层:更新、实验与恢复

目标: 避免根据噪声和传闻做破坏性改动。

动作:

  • 核心更新完成后至少等待一周再比较前后一周数据;
  • 小波动不做全站重写;
  • 大幅、持续、全站下降时再做完整质量评估;
  • 按页面类型、查询、国家、设备和搜索类型分段;
  • 优先修复明确技术阻断、政策违规和明显用户价值缺口;
  • 删除内容是最后手段,只对无法挽救且为搜索流量生产的内容使用;
  • 改进可能需数天、数周或数月被重新处理,且没有恢复保证;
  • 任何测试都记录反事实、同期更新、季节性和竞争变化,避免把同时发生误当因果。

验收: 每项改动有证据假设、范围、回滚和结果记录;不根据单日排名、单个关键词或第三方“算法天气”决定全站策略。


15. SEO/GEO 优先级:先修门禁,再做价值,再做表现

优先级 问题 典型症状 第一动作 为什么
P0 政策/安全/访问阻断 manual action、被黑、全站 noindex、5xx、DNS、robots 误封 立即解除阻断/违规并验证 不解决则无候选资格
P0 大规模错误状态/canonical 关键页不索引、错误代表 URL 统一 200/redirect/canonical/sitemap/内链 信号无法聚合或内容被排除
P1 渲染/移动内容缺失 URL Inspection 看不到主内容 修初始/渲染 HTML 与资源访问 Google 理解输入不完整
P1 无价值重复/参数空间 抓取浪费、重复集、发现慢 收敛 URL、facets、分页和重定向 改善发现与索引效率
P1 内容不能完成任务 排名/引用弱、用户继续搜索 增加第一手证据、完整答案、来源和限制 官方把独特非商品化价值置于长期核心
P2 信息架构/内链差 孤儿页、分类混乱 重构导航、锚文本、层级 改善发现、关系和用户路径
P2 title/snippet/媒体差 展示重写、低适配点击 准确 title/meta、媒体、structured data 改善理解与展示资格
P2 页面体验差 到站跳失/转化弱 主内容、移动、延迟、可访问性 提升真实用户结果,不只追分
P3 GEO 证据组织 AI 曝光弱但普通资格健康 加强可验证主张、数据口径、稳定来源页 适配 RAG/grounding 的信息需求
P3 Agentic/UCP 交易/任务型业务需要 agent 完成操作 评估 DOM/accessibility/UCP 新兴独立层,不应抢在基础 SEO 前

16. 流量下降的官方证据诊断流程

1. 是否有 Search Status update / manual action / security issue?
   ├─ 有:对齐时间与受影响类型,先处理明确问题
   └─ 无:继续

2. 是 impressions、clicks、CTR、position,还是站后 conversion 下降?
   ├─ 只有 conversion:先查网站/产品/分析,不先归咎排名
   └─ Search 指标变化:继续

3. 是否只在某国家、设备、查询、页面组或搜索类型?
   ├─ 局部:检查意图、竞争、展示和对应模板
   └─ 全局:继续

4. crawl / index / canonical / render 是否异常?
   ├─ 是:修技术门禁
   └─ 否:继续

5. Google Trends/季节性/品牌需求是否同步下降?
   ├─ 是:不要把需求下降全部当 SEO 故障
   └─ 否:继续

6. 是小幅波动还是大幅、持续、全站下降?
   ├─ 小幅:观察,避免激进修改
   └─ 大幅持续:按 people-first / spam / page-type 做全站质量审查

7. 改进后记录重新抓取、索引、排名与业务恢复周期;不承诺恢复。

来源:Debug drops in Search trafficCore updates and your website、Search Status Dashboard、Search Console/Analytics 官方集成指南。


17. 目前仍然未知、不得伪装成已知的事项

截至 2026-07-13,本文的一手证据仍不能回答:

  1. Google 当前全部 ranking systems/signals 的完整清单;
  2. 任一信号的统一权重、阈值、曲线、归一化或执行顺序;
  3. 每个查询、国家、语言、设备、垂直结果和用户上下文采用哪些模型;
  4. goodClicksbadClickslastLongestClicks 的完整当前定义;
  5. chromeInTotal 与 P* Chrome popularity 是否是同一数据/信号;
  6. Content Warehouse 2024 字段在 2026 的上线、改名、替换或废弃状态;
  7. AI Overviews / AI Mode 的候选文档数量、fan-out 数量、引用选择公式、置信度阈值和链接排序;
  8. 传统排名位置与生成式引用概率的精确函数;
  9. MAGIT 所用 “Search data” 的具体组成、数量与贡献;
  10. Search-specific post-training 是否、怎样使用匿名化 NavBoost 数据;
  11. Google-Extended 与所有 Search AI 模型训练路径的完整产品映射;
  12. 一个页面满足全部官方建议后被抓取、索引、排名或引用的概率;
  13. 站点级 Q*/siteAuthority 与任何外部可观察指标的换算;
  14. 作者实体、无链接 mention、品牌查询和真实世界声誉在每类查询中的具体作用;
  15. 任何可靠保证排名或 AI citation 的操作公式。

对这些问题,正确置信度是 未知,不是“可能所以当作事实”。


18. 最终综合判断

判断一:GEO 没有推翻 SEO;它把优质检索的后果显性化

Google 的正式口径、DOJ 对 grounding 的认定和生成式专利都指向同一结构:生成式回答位于索引、查询理解、候选检索、质量、链接、反垃圾和排名之上。GEO 真正增加的是多查询检索、综合、可验证性和链接呈现,不是另起炉灶。

置信度:高。

判断二:最稳固的优化对象是信息和系统,不是字段或指标

高证据强度的对象是:可访问、可索引、清楚 canonical、真实原创价值、第一手证据、可靠来源、完整任务、清晰结构、真实关系、准确业务数据和良好到站体验。低证据强度的对象是:第三方 authority score、CTR 秒数、段落长度、关键词密度、作者分、Chrome 流量和泄露字段权重。

置信度:高。

判断三:点击与交互真实重要,但“刷点击 SEO”从证据上站不住

NavBoost/Glue 的存在已经由法院层面确认。恰恰因为 Google 长期处理位置偏差、噪声、操纵和查询切片,才不能把它降维成 Search Console CTR 或停留秒数。最合理的业务动作是改善用户真正完成任务的概率,而不是伪造交互。

置信度:高。

判断四:站点级质量真实存在,但第三方 DA/DR 不是它

官方承认 site-wide signals/classifiers,DOJ 备忘录有 Q*,泄露有 siteAuthority/NSR/site embedding。多源证据支持站点范围评估存在;没有任何一手证据把它映射到外部工具分数、单一“主题权威度”或可以买到的域名指标。

置信度:高。

判断五:泄露没有给出配方,但它让官方宣传的抽象词变得更可信、更复杂

泄露证明 Google 内部结构确实能表示 clicks、links、quality、authority、spam、freshness、originality、attribution、entities、site topics 与 history。它同时通过 deprecated/experimental/launch-excluded 注释证明:字段存在远远不等于当前排名使用。最重要的泄露结论是“系统复杂且分层”,不是“字段可以被逐个操纵”。

置信度:高。

判断六:Google 官方文档故意给原则,不给可操纵参数

Google 公开 eligibility、政策、系统类型与用户目标;法院/DOJ 记录显示 curves、thresholds、模型和底层数据具有竞争与反操纵价值。期待官方给出“精确排名公式”不现实,也与其公开防垃圾立场冲突。

置信度:高。

判断七:真正的长期 GEO 优势是成为可验证的原始来源

Google 2026 明确强调 unique、expert-led、non-commodity;专利描述可验证摘要部分与来源链接;泄露存在 content attribution/original content 结构。把三类证据合并,最强策略不是“写给模型”,而是生产模型和用户都必须回到你的独特证据:数据、方法、第一手经验、产品事实、案例、原始文档、图像/视频和责任主体。

这最后一句是多源综合推论,不是 Google 的逐字承诺。置信度:中高。


19. 来源索引与附录说明

本研究同时提供两份完整证据台账:

  • 附录 A:Google 官方与内部人员一手公开来源台账——109 个分类证据条目、106 个唯一一手 URL;每条含日期、层级、可支持结论与边界。
  • 附录 B:Google 搜索与生成式搜索专利证据矩阵——22 组代表性专利、31 个 Google Patents 原始链接;每组含日期、状态、机制、可支持结论与不可外推边界。

Word 完整版把两份台账附在正文之后;同时单独提供 Markdown 版本,便于检索和持续维护。

19.1 DOJ / 法院核心原始材料

19.2 Content Warehouse 核心原始材料

19.3 维护规则

  • 每季度复核 Google Search Central Last updated、Search Console Help、crawler docs 和 ranking systems guide;
  • 每次核心/垃圾政策、AI control/report 或 structured-data 功能变更时,更新“当前口径”而保留历史记录;
  • 专利状态只按 Google Patents 页面记录,并保留其“非法律结论”限制;
  • DOJ 新执行/上诉/技术委员会文件必须单独分级,不能反向改写已经作出的事实认定;
  • 泄露引用永远固定 commit SHA,不能引用会变化的默认分支;
  • 新增任何推论时,明确写 X 级、反例与置信度。

20. 一页式结论

如果只能保留十句话,应保留以下十句:

  1. 对 Google Search,GEO/AEO 仍是 SEO;AI Overviews/AI Mode 依赖 Search index 与核心排名/质量系统。
  2. 抓取、索引和 snippet 资格是生成式引用的上游门槛,但永远不保证展示。
  3. Google 明确不使用 llms.txt,不要求 chunking、AI 特殊句法或 AI 专用 schema。
  4. 独特、专家/经验主导、非商品化、可验证的信息是 Google 当前最明确的长期内容方向。
  5. E-E-A-T 不是单一排名因子,quality raters 不直接排页面。
  6. PageRank/链接仍存在;NavBoost/Glue 的查询—点击交互用途也已由法院证据确认。
  7. 点击不是裸 CTR;位置偏差、噪声、切片、聚合与反操纵使“刷点击公式”没有证据基础。
  8. 2024 泄露是约 14,000 个 schema 字段,不是 14,000 个排名因子;没有权重、阈值或完整调用图。
  9. 专利说明 Google 曾保护什么机制,不说明 2026 当前全部生产实现。
  10. 可持续的 SEO/GEO 工作就是:保证资格与可理解性,生产原始可验证价值,建立真实关系与体验,用第一方数据诊断,不把未知伪装成公式。

附录 A|Google 官方与内部人员一手公开来源台账

核验快照:2026-07-13(Asia/Singapore)

文档性质:证据台账,不是 SEO / GEO 教程,不给出第三方“最佳实践”。

纳入范围:Google 官方文档、Google 官方帮助中心、Google 官方博客、Google 员工署名的一手公开发言,以及员工在原始会议录像中的发言。

排除范围:SEO 工具商、代理商、媒体转述、匿名“泄露解读”、搜索结果摘要、二手采访摘要、未经原始材料佐证的行业共识。专利和 DOJ 证词另建独立证据台账,不在本文件重复。

0. 使用规则与证据层级

这份台账回答的是“Google 的一手材料实际支持什么结论”,而不是“怎样保证排名”。阅读时必须遵守以下优先级:

  1. 当前有效的官方规范、政策与帮助文档,优先于旧博客、旧演讲和员工即兴问答。
  2. 产品公告可证明功能、发布日期和官方表述,但不能自动证明某功能是排名信号。
  3. 员工署名文章或原始演讲是高价值的一手解释,但除非被当前规范重申,否则不应提升为永久、完整、不可变的算法规则。
  4. Search Quality Rater Guidelines(质量评估员指南)描述 Google 希望评估的结果质量;Google 明确说评分员数据不直接决定某网页或网站排名。
  5. “可被抓取”“可被索引”“有资格展示”“实际被索引”“获得富媒体结果”“获得高排名”是六个不同命题,不能互换。
  6. 文档页脚的 Last updated 是整页更新时间,不等于该页每一句话都在当天首次发布。
  7. Google Help Center 的许多页面不公开发布日期;本台账如实记为“未显示”,并附当前核验日,不猜测日期。

证据层级

层级 定义 适合支持的结论 主要限制
A1 当前官方规范、政策、开发者文档或产品帮助 当前资格条件、控制项、报告口径、Google 明示的系统原则 仍不等于排名保证;官方文档可能继续更新
A2 Google 官方产品公告、状态页、署名发布说明 产品发布时间、变更范围、官方解释 通常是时间点快照;可能被后续文档取代
B1 Google 员工在 Google 官方渠道的署名一手文章或讲话 架构解释、背景、限制和官方意图 解释性、可能简化;旧材料可能过时
B2 Google 员工在非 Google 域名上的原始完整录像或原始采访 发言者当时亲口说明的内容 非规范、历史性强;不可外推为当前完整算法
C Google 官方历史材料,已被新版文档明显更新或局部取代 说明制度演进和当时状态 不能作为当前实施规则单独使用

置信度

  • :当前官方页面直接、明确支持,且结论未越过页面边界。
  • :一手材料支持,但属于历史快照、员工解释,或帮助页没有公开更新时间。
  • :本台账原则上不收录;若材料只能支持推测,则直接写“不能推出”,不把推测列为事实。

1. 基础规范与 Google Search 工作方式

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
F-01 Google Search Essentials (formerly Webmaster Guidelines) 最后更新 2025-12-10;Google Search Central A1 / 高 Google 将基础要求组织为技术要求、垃圾内容政策和关键最佳实践;满足这些要求是参与 Search 的基础。 不是排名因子清单;满足要求不保证抓取、索引、展示或排名。
F-02 Google Search technical requirements 最后更新 2025-12-18;Google Search Central A1 / 高 最低技术资格包括:Googlebot 未被阻止、页面返回成功状态、页面含可索引内容。Google 明确说大多数网站无需额外技术操作即可满足。 “符合最低资格”只表示可能进入索引,不保证被索引;也不能推出技术合规足以获得高排名。
F-03 Spam Policies for Google Web Search 最后更新 2026-05-15;Google Search Central A1 / 高 当前官方垃圾内容政策总表;覆盖伪装、门页、过期域名滥用、黑客内容、隐藏文字与链接、关键词堆砌、链接垃圾、机器生成流量、规模化内容滥用、站点声誉滥用等。违规可能导致降级、完全不展示或人工处置。 政策类别不是算法特征清单;不能由“未被人工处置”反推内容一定高质量或一定不会被算法降级。
F-04 SEO Starter Guide: The Basics 最后更新 2025-12-10;Google Search Central A1 / 高 Google 面向站点所有者的基础总览;覆盖组织结构、描述性 URL、重复内容、标题、链接、图像、推广与 Search Console。文档明确否认秘密捷径和保证第一名。 是入门材料,不是完整排名系统说明;其示例不构成对所有站点的硬性要求。
F-05 In-Depth Guide to How Google Search Works 最后更新 2025-12-18;Google Search Central A1 / 高 官方将 Search 流程概括为抓取、索引、提供搜索结果;Google 自动发现 URL、渲染页面、理解并选择规范 URL,再按查询提供结果。 流程图是概念模型,不披露全部算法、权重、实时系统或每个查询的路径;“被索引”不等于“会展示”。
F-06 Google Search Status Dashboard 持续更新;Google A2 / 高 可用于核对 Google 正式确认的排名更新、抓取/索引/服务异常及其起止时间。 状态页不能证明单个网站流量变化由某次更新造成,也不披露更新的具体信号和权重。

2. 技术 SEO:抓取、渲染、索引、规范化与展示

2.1 爬虫身份、抓取与响应

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-01 Google Crawler (User Agent) Overview 最后更新 2026-06-12;Google Search Central A1 / 高 Google 区分 common crawlers、special-case crawlers 和 user-triggered fetchers;可据此识别用途与 robots.txt token。 User-Agent 字符串可被伪造;仅凭 UA 不能验证来源,需结合官方反向/正向 DNS 验证方法。
T-02 What Is Googlebot 最后更新 2026-02-03;Google Search Central A1 / 高 Googlebot 是 Google Search 的通用爬虫名称,主要以智能手机爬虫抓取;官方说明如何验证 Googlebot 及抓取 IP 范围。 “Googlebot 可访问”不表示页面会被索引;Googlebot 的抓取方式、限额和 UA 会调整。
T-03 Google's common crawlers 最后更新 2026-04-23;Google A1 / 高 当前官方 common crawler 名单、robots token 和用途;Google-Extended 是独立 robots token,没有独立 HTTP 请求 UA,可控制内容用于未来 Gemini 模型训练及 Gemini Apps / Vertex AI grounding,并明确不影响 Google Search 收录或排名。 Google-Extended 不是阻止 Google Search AI 功能引用/展示的开关;不能把训练控制与 Search 中的抓取、索引、排名或新的 Search generative AI control 混为一谈。
T-04 How HTTP Status Codes Affect Google's Crawlers 最后更新 2026-02-04;Google Search Central A1 / 高 官方说明 2xx、3xx、4xx、5xx、网络/DNS 错误对 Google 抓取和索引的通常影响;只有成功响应内容会进入索引处理,持续错误会影响抓取。 状态码只说明处理路径,不保证 canonical、索引或排名;软 404 是 Google 对内容的判断,不只看 HTTP 码。
T-05 File Types Indexable by Google 最后更新 2026-02-03;Google Search Central A1 / 高 列出 Google 可索引的常见文本、文档、图像、视频等文件类型。 “支持的文件类型”仅是技术可处理性,不代表每个文件都会被抓取、理解、索引或显示。
T-06 Crawl Budget Management 最后更新 2025-12-19;Google Search Central A1 / 高 Crawl budget 由 crawl capacity limit 与 crawl demand 共同作用;文档给出大型、高频更新站点的诊断和资源管理框架。 Google 明确表明多数站点无需管理 crawl budget;不能把抓取次数当排名指标,也不能假设提高抓取率会提高排名。
T-07 SEO Link Best Practices for Google 最后更新 2025-12-10;Google Search Central A1 / 高 Google 最可靠地抓取标准 <a href> 链接;锚文本帮助用户和 Google 理解目标页;内部和外部链接应有语境。 可抓取链接不保证抓取或传递固定“权重”;文档不支持用机械化锚文本比例或固定内链数量优化。
T-08 URL Structure Best Practices for Google Search 最后更新 2025-12-10;Google Search Central A1 / 高 建议使用简单、描述性、可读、稳定的 URL,并控制参数、会话 ID、无限组合等可能造成的抓取问题。 URL 中出现关键词不是排名保证;不能从“描述性 URL”推出改 URL 值得承担迁移风险。

2.2 robots.txt、robots meta 与预览控制

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-09 Robots.txt Introduction and Guide 最后更新 2025-12-10;Google Search Central A1 / 高 robots.txt 主要用于管理爬虫访问,必须位于主机根路径并按主机/协议生效。 robots.txt 不是可靠的移除索引手段;被阻止抓取的 URL 仍可能仅凭外部信号以无摘要形式出现。
T-10 How Google Interprets the robots.txt Specification 最后更新 2026-07-08;Google Search Central A1 / 高 Google 对 robots.txt 语法、匹配、分组、缓存、错误响应和 RFC 9309 的实际解释。 这是 Google 爬虫实现说明,不代表所有搜索引擎完全一致;语法匹配不等于索引控制。
T-11 Robots Meta Tags Specifications 最后更新 2026-03-24;Google Search Central A1 / 高 noindexnofollownosnippetmax-snippetmax-image-previewmax-video-previewdata-nosnippet 等可控制索引和搜索预览;当前文档明确说明部分预览控制也适用于 AI Overviews / AI Mode 的直接输入与展示。 指令必须在 Google 可抓取页面时才能被读取;nosnippet 等控制的是摘要/直接输入,不等于禁止所有链接发现、排名或所有非 Search AI 训练用途。
T-12 Block Search Indexing with noindex 最后更新 2025-12-10;Google Search Central A1 / 高 在可抓取的 HTML meta 或 HTTP header 中使用 noindex,可要求 Google 不在搜索结果中展示该内容。 同时用 robots.txt 阻止抓取会妨碍 Google 读取 noindexnoindex 不是即时删除保证,需等待重新抓取处理。

2.3 Sitemap、重复 URL、canonical、重定向与迁移

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-13 What Is a Sitemap 最后更新 2025-12-10;Google Search Central A1 / 高 Sitemap 是向搜索引擎提供站点页面、视频、图像等信息的文件,对大型、新站、深层链接或富媒体站点更有帮助。 Sitemap 是发现与 canonical 的弱提示,不保证抓取、索引或排名;小型且内链完整的站点可能无需 sitemap。
T-14 Build and Submit a Sitemap 最后更新 2026-07-08;Google Search Central A1 / 高 官方规定 XML、RSS/Atom、文本 sitemap 的格式、大小限制、URL 规则与提交方式;建议只列希望出现在 Search 的 canonical URL。 提交成功只表示 Google 可读取文件,不代表列出的 URL 被索引;prioritychangefreq 不应被解读为排名控制器。
T-15 How to Specify a Canonical with rel="canonical" and Other Methods 最后更新 2026-07-10;Google Search Central A1 / 高 重定向和 rel="canonical" 是较强 canonical 信号,sitemap 较弱;信号可叠加。Google 会聚合重复 URL 信号并选择代表 URL。 用户声明的是偏好而非命令;Google 可能选择其他 canonical。robots.txt、URL Removal 工具和 noindex 不应被当作 canonicalization 方法。
T-16 Fix Canonicalization Issues 最后更新 2026-07-10;Google Search Central A1 / 高 官方列出 Search Console 中用户声明 canonical 与 Google 选择 canonical 不一致的常见原因和诊断路径。 不一致本身不证明惩罚或错误;Google 选择 canonical 是聚类和信号判断结果,不能通过单一标签绝对强制。
T-17 Redirects and Google Search 最后更新 2026-04-14;Google Search Central A1 / 高 服务器端永久重定向是迁移 URL 的强信号;官方区分永久、临时、JavaScript 与 meta refresh 等方式并说明优先级。 任何重定向都不保证立即传递全部信号或立即替换索引;无关目的地、链式/循环跳转可能被不同处理。
T-18 Site Moves and Migrations 最后更新 2026-06-17;Google Search Central A1 / 高 官方给出变更 URL 的迁移流程:建立映射、永久重定向、更新 canonical/内链/sitemap、验证新旧站并监控;迁移期间排名波动属可预期。 不是“无损迁移”保证;处理时间依站点规模和抓取而异,Change of Address 也不能代替 URL 级重定向。
T-19 A/B Testing Best Practices for Search 最后更新 2025-12-10;Google Search Central A1 / 高 正常 A/B 测试不是伪装;可用 canonical、临时重定向,并应在实验结束后清理。 长期向 Googlebot 与用户展示不同内容可能构成伪装;文档不证明任一测试变体会提升排名。

2.4 Faceted navigation、分页与大规模 URL 空间

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-20 Managing crawling of faceted navigation URLs 最后更新 2025-12-18;Google Search Central A1 / 高 筛选、排序、参数组合可制造近乎无限 URL 并消耗抓取资源;官方给出完全阻止或有选择开放的两种框架。 不是要求所有电商站屏蔽筛选页;是否允许索引取决于页面独特价值和技术设计,不能套用单一参数规则。
T-21 Pagination Best Practices for Google 最后更新 2025-12-10;Google Search Central A1 / 高 Googlebot 通常不点击按钮;分页内容应通过可抓取 URL 和 <a href> 连接,各页可自 canonical,并避免只依赖滚动或点击加载。 Google 不再使用 rel="next"/"prev" 作为分页索引信号;把所有分页 canonical 到第一页可能使后续商品难以索引。

2.5 JavaScript、渲染与延迟加载

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-22 Understand JavaScript SEO Basics 最后更新 2026-03-04;Google Search Central A1 / 高 Googlebot 会抓取、排队渲染并再次处理 JavaScript 页面;服务器端或预渲染仍有速度、兼容性和资源方面的稳健性优势。 “Google 能渲染 JavaScript”不等于所有脚本必然成功、及时或等价于服务器 HTML;渲染可被资源阻挡、错误和超时影响。
T-23 Fix Search-Related JavaScript Problems 最后更新 2025-12-18;Google Search Central A1 / 高 提供用 URL Inspection、移动设备测试、日志和渲染输出来诊断 JS 内容、状态码、软 404、canonical 与 meta 指令的方法。 测试工具成功不保证索引;工具是时间点测试,不能替代生产日志和实际索引状态。
T-24 Dynamic Rendering as a workaround 最后更新 2025-12-10;Google Search Central A1 / 高 Google 将 dynamic rendering 明确定义为针对爬虫的“workaround”,并建议服务器端渲染、静态渲染或 hydration 作为长期方案。 它不是推荐的长期架构,也不能用于向爬虫提供实质不同的操纵性内容;不能由“允许 workaround”推导为 cloaking 豁免。
T-25 Fix Lazy-Loaded Website Content 最后更新 2025-12-10;Google Search Central A1 / 高 延迟加载内容必须在可见区域触发之外仍能被 Google 获取;不得依赖滚动、滑动、点击等用户交互;可用可抓取分页/链接和 IntersectionObserver。 不能从测试截图出现内容推断所有 URL、图片或后续分页均会被索引。

2.6 移动优先、国际化、图像、视频与搜索外观

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
T-26 Mobile-first Indexing Best Practices 最后更新 2025-12-10;Google Search Central A1 / 高 Google 主要使用移动版内容进行索引与排名;移动版应保留与桌面版等价的主要内容、标题、meta、结构化数据、图像及 alt 文本。响应式设计是最易实施和维护的方式。 响应式设计不是排名奖励;“等价”不要求像素完全一致,但缺失内容可能使 Google 无法以桌面版信息替代。
T-27 Localized Versions of your Pages 最后更新 2025-12-22;Google Search Central A1 / 高 hreflang、HTTP header 和 sitemap 可向 Google 声明语言/地区替代页;注释应互相返回并使用有效代码。 hreflang 是语言/地区匹配信号,不是 canonical,也不是排名提升保证;错误注释可能被忽略。
T-28 Managing Multi-Regional and Multilingual Sites 最后更新 2025-12-10;Google Search Central A1 / 高 官方比较 ccTLD、子域、子目录等地理定位结构,建议明确语言、避免仅凭 IP 自动重定向,并允许用户切换。 Google 不宣布某一种 URL 结构普遍排名更高;结构选择有成本与运营权衡。
T-29 How Google Crawls Locale-Adaptive Pages 最后更新 2025-12-10;Google Search Central A1 / 高 Googlebot 通常从美国 IP 抓取且默认不发送 Accept-Language;同一 URL 按地域/语言变化可能导致部分变体不被发现,独立 URL 与 hreflang 更可发现。 不能假设 Google 会遍历所有 IP/语言组合;这也不是禁止任何个性化,而是发现能力边界。
T-30 Image SEO Best Practices 最后更新 2026-03-02;Google Search Central A1 / 高 高质量、相关上下文、可抓取图片、描述性 alt、支持格式、响应式实现和 image sitemap 可帮助 Google 理解与发现图像。 alt 文本首先是可访问性与语义描述,不是关键词容器;满足图像要求不保证出现在 Google Images 或富结果。
T-31 Video SEO Best Practices 最后更新 2025-12-18;Google Search Central A1 / 高 视频需位于可索引观看页并可被 Google 发现;稳定缩略图、视频文件、结构化数据和 video sitemap 可帮助理解与展示。 视频 schema 或 sitemap 只提供线索和资格;不能保证视频索引、关键时刻或视频富结果。
T-32 Get on Discover 最后更新 2026-03-09;Google Search Central A1 / 高 已索引且符合 Discover 内容政策的内容自动具备资格,无需特殊标签;Google建议有吸引力但不误导的标题和高质量大图。Discover 流量本质上不可预测、应视为补充流量。 资格不等于展示;不能保证稳定流量,也不能把 Discover 波动等同于 Search 排名惩罚。
T-33 Influencing Title Links in Google Search 最后更新 2025-12-10;Google Search Central A1 / 高 标题链接可来自 <title>、页面主视觉标题、<h1>og:title、锚文本等多个来源;Google 可自动改写以提高相关性和可读性。 <title> 不是对搜索结果标题的强制指令;某次改写不能直接证明惩罚或排名下降原因。
T-34 How to Write Meta Descriptions 最后更新 2026-04-20;Google Search Central A1 / 高 Google 主要从页面内容自动生成摘要,也可能使用 meta description;不同查询可显示不同摘要,预览指令可限制摘要。 meta description 不是固定展示文案,文档也不把它列为直接排名保证;批量模板不能保证更高 CTR 或排名。
T-35 Help Google News discover your web crawled content 未显示;2026-07-13 核验;Google Publisher Center Help A1 / 中 发布者无需提交网站即可具备在 Google News surfaces 展示内容的资格;Google 通过 Search technologies 算法发现新闻内容,且明确不保证每篇文章获得发布或影响其排名。 自动发现与自动纳入考虑不是保证收录、展示或排名;符合政策只是资格条件。
T-36 Google News transitions to automatically-generated publication pages 发布 2025-02-10;更新 2025-03-20;Google Publisher Center Help A2 / 高 Google News 于 2025-03 全面转向自动生成 publication pages,不再使用 Publisher Center 提交的 RSS feeds 或 web locations;合规内容自动具备被考虑资格。 自动生成 publication page 不保证某 publication 拥有落地页,也不保证文章展示或排名;Publisher Center 配置不是纳入捷径。

3. 内容质量、排名系统、页面体验与生成式内容

3.1 People-first content、E-E-A-T 与质量评估

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
Q-01 Creating Helpful, Reliable, People-First Content 最后更新 2025-12-10;Google Search Central A1 / 高 官方自评框架强调原创信息、完整且实质性的说明、超越简单改写、清晰来源、可验证专长/第一手经验、令人信任的作者与站点背景,以及“为人而作”的主要目的。 自评问题不是逐项排名因子或打分表;Google 明确否认“偏好某个字数”。不能把改日期、批量增删内容、覆盖大量话题当作自动提鲜或排名策略。
Q-02 Search Quality Evaluator Guidelines General Guidelines,2025-09-11,182 页;Google A1(评估规范)/ 高 当前公开质量评估员指南;定义 Needs Met、Page Quality、页面目的、主内容、网站/创作者信息、声誉、Experience / Expertise / Authoritativeness / Trust、YMYL 等评估概念,可证明 Google 希望结果符合哪些质量目标。 不是排名算法说明、因子清单或 SEO 打分模板;评分员不直接改变被评页面/网站的排名。指南中的例子用于训练一致评估,不能机械外推到全部查询。
Q-03 Search Quality Raters Guidelines update 2023-11-16;Elizabeth Tucker,Google Search Quality team B1 / 高 Google 公开说明评估员依据指南评估 Search 结果质量,结果用于衡量系统表现和改进方向。 员工文章明确否定“评分直接影响页面排名”;也不能从一次指南更新推导同日发生某个算法更新。
Q-04 An overview of our rater guidelines for Search 2021-10-19;Danny Sullivan B1 / 高 官方解释评估员用代表性查询比较结果质量,反馈帮助 Google 判断系统是否实现预期,类似餐厅用反馈卡评估服务。 历史解释性文章;不披露评分如何汇总、具体实验阈值或排名权重。明确不能把评分员当作人工调整个站排名的队伍。

3.2 排名系统、核心更新、评论系统与第三方工具

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
Q-05 A Guide to Google Search Ranking Systems 最后更新 2025-12-10;Google Search Central A1 / 高 Google 使用多个自动化排名系统,并列出部分仍在使用的系统/概念,例如 BERT、危机信息、去重、精确匹配域名、freshness、link analysis/PageRank、本地新闻、MUM、neural matching、original content、passage、RankBrain、reliable information、reviews、site diversity、spam detection。也列出部分退役或并入核心系统的历史系统。 清单并非完整算法、权重或可操作配方;系统名称不等于单一排名因子。页面明确说明 Helpful Content system 在 2024-03 被并入核心排名系统,因此不能再把它当独立更新追踪。
Q-06 Google Search's Core Updates 最后更新 2025-12-10;Google Search Central A1 / 高 核心更新是对整体结果评估方式的广泛调整,不针对特定页面或网站。排名下降可能并不表示违反政策;官方建议从整体内容质量和长期改进评估,而非寻找单一修复。 不能由“核心更新”解释任意流量下降,也没有官方“恢复日期”保证;改动后恢复可能不等到下一次核心更新,也可能仍无改善。
Q-07 Google Search's Reviews System 最后更新 2025-12-10;Google Search Central A1 / 高 Reviews system 旨在奖励有洞察分析、原创研究、由熟悉主题的专家或爱好者写成的高质量评论;主要按页面评估,评论占比高的网站也可能获得更广泛评估。 不能推出固定评论字数、星级 schema 或“第一人称”必然提升排名;该系统与结构化数据富结果资格不是同一机制。
Q-08 Google Search's Guidance on Third-Party SEO Tools & Advice 最后更新 2026-06-05;Google Search Central A1 / 高 Google 明确不审查、不背书第三方 SEO 服务;第三方工具无法访问 Google 内部排名数据,估算指标可能与 Google 不同;任何排名或流量保证都应被质疑。 不是说所有第三方工具毫无用途;它们可用于抓取、监控和工作流,但其“authority score”“AI visibility”等私有指标不能冒充 Google 官方信号。

3.3 页面体验与 Core Web Vitals

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
Q-09 Understanding Google Page Experience 最后更新 2025-12-10;Google Search Central A1 / 高 Google 的核心排名系统会考虑与整体页面体验相符的多种信号;没有单一“page experience signal”。相关问题包括 CWV、HTTPS、移动显示、侵入式插页、主内容与广告区分等。 不能把任何工具的单一总分当 Google 排名分;优秀体验不保证顶级排名,相关性更强的内容仍可能在部分体验指标较差时排名更高。
Q-10 Understanding Core Web Vitals and Google search results 最后更新 2025-12-10;Google Search Central A1 / 高 Core Web Vitals 被 Google 排名系统使用;当前指标为 LCP、INP、CLS,官方建议达到良好阈值以改善用户体验。 良好 CWV 不保证高排名;CWV 不是全部页面体验,越过“good”阈值继续追分也没有官方线性排名收益承诺。

3.4 生成式 AI 内容

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
Q-11 Google Search's Guidance on Generative AI Content on Your Website 最后更新 2025-12-10;Google Search Central A1 / 高 使用生成式 AI 本身不违反 Google 指南;关键是内容是否准确、优质、相关并符合 Search Essentials。用生成式 AI 大量生成没有用户价值的页面,可能触犯 scaled content abuse。 不能推出“AI 内容与人工内容永远被完全相同处理”,也不能推出 AI 内容有特殊排名奖励。Google 判断的是目的与结果质量,不是给出某种检测器阈值。
Q-12 Google Search's guidance about AI-generated content 2023-02-08;Danny Sullivan、Chris Nelson,代表 Google Search Quality team C / 高 2023 年官方立场的原始公告:适当使用 AI/自动化并非天然违反政策;主要为操纵排名而自动生成内容长期以来违反垃圾内容政策;E-E-A-T 导向仍适用。 当前以 Q-11 和 F-03 为准。不能引用此旧文忽略 2024–2026 对 scaled content abuse 的更新,也不能将其曲解为 Google “批准”任意 AI 批量内容。

内容质量核心结论的官方边界

  1. E-E-A-T 不是一个单独排名因子。 Q-01 明确说明 Google 使用多种信号识别符合 E-E-A-T 的内容;Trust 是其中最重要的概念,YMYL 主题更重视强 E-E-A-T。它不支持“给作者页加几个字段就获得 E-E-A-T 分”。
  2. 质量评估员不是排名操作员。 Q-02 至 Q-04 支持“评分用于评估系统是否产生良好结果”,不支持“某个评分员给网站打分后直接升降排名”。
  3. 字数、发布日期和内容量没有官方万能阈值。 Q-01 直接否认偏好特定字数,也警告不要仅通过改日期或大量新增/删除内容制造“新鲜”外观。
  4. 生成方式不是唯一判断标准。 Q-11/Q-12 支持“AI 并非天然违规”;F-03 同时支持“规模化生成低价值内容,无论由人、自动化或二者结合,都可能违规”。

4. Structured Data:资格、政策、支持类型与边界

4.1 总则与当前功能清单

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SD-01 Intro to How Structured Data Markup Works 最后更新 2025-12-10;Google Search Central A1 / 高 结构化数据为页面含义提供明确线索,并使页面有资格获得特定搜索外观;Google 支持 JSON-LD、Microdata、RDFa,通常推荐 JSON-LD 便于维护。 正确 markup 只带来资格,不保证富结果展示,也没有官方保证其本身提高普通网页排名。
SD-02 General Structured Data Guidelines 最后更新 2026-07-10;Google Search Central A1 / 高 当前通用政策要求内容可访问、与页面可见内容一致、不误导、代表主要内容,并同时满足技术、质量和具体功能指南。违反可导致结构化数据人工处置。 语法验证通过不代表符合质量政策;结构化数据人工处置通常影响富结果资格,不等于普通网页索引/排名必然被移除。
SD-03 Structured Data Markup that Google Search Supports 最后更新 2026-06-15;Google Search Central A1 / 高 这是 Google Search 当前支持的结构化数据功能权威目录,应以它和各功能文档判断 Google 是否支持某 schema 类型。 schema.org 中存在某类型不等于 Google Search 支持相应富结果;功能也可按地区、设备或时间调整、限制或退役。
SD-04 Generate Structured Data with JavaScript 最后更新 2025-12-10;Google Search Central A1 / 高 Google 可处理页面渲染后由 JavaScript 生成的结构化数据,并给出 Google Tag Manager、自定义 JS 与测试方式。 能渲染不等于稳定、即时或无错误;动态生成仍须与可见内容一致,并受 JavaScript 抓取/渲染边界约束。

4.2 内容、实体、作者与导航

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SD-05 Learn About Article Schema Markup 最后更新 2025-12-10;Google Search Central A1 / 高 ArticleNewsArticleBlogPosting 可帮助 Google 理解标题、图片、日期和作者信息,并可能改进在 Google Search 中的文章展示。 Article schema 不是进入 Google News、Discover、Top stories 或获得排名的保证;没有必填属性也不代表少填信息更好。
SD-06 Organization Schema Markup 最后更新 2026-04-15;Google Search Central A1 / 高 首页上的 Organization markup 可帮助 Google 区分组织并理解名称、地址、联系方式、logo、标识符等管理信息。 不能“创建权威性”或强制 Knowledge Panel;markup 必须对应真实、可验证组织信息。
SD-07 Profile Page (ProfilePage) Schema Markup 最后更新 2025-12-10;Google Search Central A1 / 高 ProfilePage 用于人物或组织作为主要创作者/参与者的页面,可帮助 Google 理解 creator、dateCreated、dateModified 等。 不是通用作者页排名标记,也不直接产生“作者权威分”;页面必须真的是单一人物/组织的主要资料页。
SD-08 How To Add Breadcrumb (BreadcrumbList) Markup 最后更新 2025-12-10;Google Search Central A1 / 高 Breadcrumb structured data 可帮助 Google 在搜索结果中按典型用户路径呈现页面层级。 不会替代可用站点导航,也不保证 Google 按标记文本显示;可提供多条合理路径,但不能伪造层级。

4.3 商品、评论、视频、付费墙与数据集

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SD-09 Intro to Product Structured Data on Google 最后更新 2025-12-10;Google Search Central A1 / 高 Product markup 可让商品页有资格显示价格、库存、评分、配送等丰富信息;网页结构化数据与 Merchant Center feed 可共同提高 Google 对商品数据的理解。 不保证 Merchant listing、Product snippet、Shopping 展示或排名;数据必须与页面/Feed 一致并保持更新。
SD-10 Product Variant Structured Data (ProductGroup, Product) 最后更新 2026-05-20;Google Search Central A1 / 高 ProductGrouphasVariantvariesByproductGroupID 可表达颜色/尺寸等商品变体关系,并支持单页或多页变体结构。 标记不能修复不可抓取的变体 URL、错误 canonical 或库存数据;也不保证所有变体被单独索引。
SD-11 How To Add Merchant Listing Structured Data 最后更新 2026-07-07;Google Search Central A1 / 高 面向可购买商品页的 merchant listing 要求与推荐字段,覆盖 offer、价格、可用性、退货、会员价、配送等。 资格受 Merchant listing 政策、数据准确性、地区和产品类型限制;不能从验证通过推出免费商品结果或排名。
SD-12 Review Snippet (Review, AggregateRating) Structured Data 最后更新 2025-12-10;Google Search Central A1 / 高 对受支持类型的真实评论/聚合评分可带来 review snippet 资格;评分内容需在页面可见并指向明确项目。 自利性 Organization/LocalBusiness 评论星级可能不显示;markup 不能制造声誉或证明评论真实,也不是 Reviews ranking system 的替代品。
SD-13 Video (VideoObject, Clip, BroadcastEvent) Schema Markup 最后更新 2026-02-13;Google Search Central A1 / 高 VideoObject 可提供缩略图、上传日期、时长、内容 URL,Clip/SeekToAction 可提供关键时刻,BroadcastEvent 可描述直播。 字段正确不保证视频富结果、LIVE 徽章或 key moments;Google 仍需能抓取观看页、视频和缩略图。
SD-14 Subscription and Paywalled Content Markup 最后更新 2025-12-10;Google Search Central A1 / 高 isAccessibleForFreehasPart 可向 Google 区分合规付费墙内容和 cloaking;Googlebot 访问策略还须遵守 Flexible Sampling 指南。 标记付费墙不保证索引或排名,也不允许向 Google 展示与登录用户实质不同的操纵性内容。
SD-15 Dataset Structured Data 最后更新 2025-12-10;Google Search Central A1 / 高 Dataset markup 可帮助 Google Dataset Search 发现并理解数据集,支持名称、描述、分发格式、许可、空间/时间范围等。 不保证数据集被纳入或排名;页面必须描述真实可访问的数据集,不能把普通文章伪装成 Dataset。

4.4 功能收缩的官方实例

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SD-16 Changes to HowTo and FAQ rich results 发布 2023-08-08;更新 2023-09-14;John Mueller C / 高 FAQ rich results 被限制为知名且权威的政府和健康网站;HowTo rich results 后续弃用。对大多数网站,保留相关 markup 不会造成 Search 问题但也没有可见效果。 这是功能变更历史,不证明 FAQ 内容本身不被索引,也不证明 FAQ schema 曾经或现在提高普通排名。当前 FAQ 旧文档 URL 已重定向到文档更新页,不能再当作普遍可用功能指南。

Structured Data 的官方底线

  • 结构化数据表达页面已有事实,不创造事实。 SD-02 要求标记与用户可见内容一致。
  • schema.org 是词汇表,不是 Google 产品承诺。 判断 Google Search 功能必须以 SD-03 及具体 Search Central 文档为准。
  • 验证通过只证明机器可解析。 富结果仍取决于政策、页面质量、查询、地区、设备和 Google 的系统判断。
  • 没有“AI 专用 schema”。 见第 6 节 G-01;Google 2026 官方 GEO 指南明确否认 Search 的生成式 AI 功能需要特殊 schema。

5. Search Console:数据、诊断、限制与 AI 报告

support.google.com/webmasters 的下列帮助页在当前页面中没有公开发布日期或 Last updated。日期栏因此记为“未显示;2026-07-13 核验”,而不是猜测发布日期。Help Center 页面属于当前产品说明,内容仍可能随界面和口径更新。

5.1 产品定位与常规性能数据

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SC-01 About Search Console 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 Search Console 帮助网站所有者监控 Google Search 中的表现、索引状态和问题;无需每天登录,也不是网站出现在 Google 的前置条件。 它不是完整的内部索引、链接图或排名系统接口;没有报告的数据不必然表示 Google 从未见过。
SC-02 How To Use Search Console 最后更新 2025-12-10;Google Search Central A1 / 高 官方按角色与维护频率说明 Search Console 的使用范围:验证所有权、检查索引、监控性能、错误和增强功能。 操作流程不是排名配方;提交或验证属性不会提高排名。
SC-03 Performance report (Search results): Overview and basic setup 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 Search results Performance report 提供 clicks、impressions、CTR、average position,以及 query、page、country、device、search appearance、date 等维度;官方定义每项指标和聚合规则。 数据不是逐次排名日志。隐私、行数上限、canonical 归并和稀有查询会造成缺失;图表属性级汇总与表格按维度汇总可能不同。Average position 不是“网站整体排名”,个性化、地点、设备和时间都会影响实际展示。
SC-04 Using Search Console and Google Analytics Data for SEO 最后更新 2026-01-07;Google Search Central A1 / 高 Search Console 衡量 Google Search 展示前后的搜索表现,Google Analytics 衡量进入站点后的行为;两者定义、时区、归因和数据处理不同,应联合但不能直接当作相同数字。 点击数与 GA session/user 不会天然一一对应;差异不自动表示追踪错误或 Google 漏数。
SC-05 Debug Google Search Traffic Drops 最后更新 2025-12-10;Google Search Central A1 / 高 官方建议先判断下降形态与时间,再区分算法更新、技术问题、安全问题、垃圾处置、季节性和用户兴趣变化,并结合 Search Console 与 Trends。 走势图形只能帮助提出假设,不能单独确定因果;不能把与核心更新日期接近等同于已证明受该更新影响。

5.2 URL、索引、Sitemap 与抓取诊断

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SC-06 URL Inspection tool 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 可查看 Google 索引中某 URL 的上次索引版本、抓取、canonical、增强功能等,也可执行 live test 并请求索引。 索引检查显示的是 Google 最近索引版本,不是实时页面;“URL is on Google”不保证每个查询实际提供该 URL。Live test 只测试可访问/可索引性,不能预测最终 canonical、内容质量、人工处置、安全/法律移除或实际索引;Request indexing 也不保证收录。
SC-07 Page indexing report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 报告显示 Google 已知页面的索引与未索引状态,并按原因分组,可验证修复。 不是全站 URL 的绝对完整清单,也不衡量排名或页面质量;“Crawled/Discovered - currently not indexed”不能仅凭状态名确定唯一根因或永久结局。
SC-08 Sitemaps report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 可提交 sitemap、查看读取状态、发现的 URL 数量与错误。 仅列通过报告/API 提交的 sitemap,Google 以其他方式发现的 sitemap 可能不在列表;成功读取不表示 URL 已抓取或索引。
SC-09 Crawl Stats report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 为域名级或根属性提供 Googlebot 请求、下载量、响应时间、主机可用性、响应码、文件类型和 crawler purpose 等抓取统计。 是抓取活动和主机健康视图,不是索引或排名报告;抽样、属性边界和 Google 各类爬虫范围会限制“总量”解释。抓取量上升/下降不等于排名上升/下降。

5.3 人工处置、安全、链接与 Core Web Vitals

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SC-10 Manual actions report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 显示人工审核认定违反 Google spam policies 的问题、受影响范围和 reconsideration 流程;人工处置可导致部分或全部页面降级/移除。 “No issues detected”只表示没有报告中的人工处置,不表示没有算法性降级、技术问题或质量问题。Reconsideration 获批也不保证恢复原排名。
SC-11 Security issues report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 报告恶意软件、欺骗页面、有害下载、黑客内容等 Google 检测到的安全问题,并提供复核流程。 不是全面安全扫描器;无报告不证明站点绝对安全,修复安全问题也不直接保证排名恢复。
SC-12 Links report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 提供部分 top linking sites、top linked pages、linking text 与内部链接视图,可用于发现关系和异常。 不是 Google 完整链接图,也不显示 PageRank、链接权重或每条链接的排名贡献;第三方工具与该报告数量不同不必然有一方“错误”。
SC-13 Core Web Vitals report 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 使用真实用户 Chrome UX Report 数据,将相似 URL 分组并按 LCP、INP、CLS 评为 Poor / Need improvement / Good,用于发现站点范围的体验问题。 是字段数据分组,不是单 URL 实验室分数或排名分;没有足够数据的 URL 可能不显示,修复验证也不保证排名变化。

5.4 Search 的生成式 AI 控制与报告

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
SC-14 Search generative AI control 未显示;2026-07-13 核验;Google Search Console Help;分批开放 A1 / 中 Search Console 的属性级 Include / Exclude / Inherit 控制可决定站点内容是否可在 AI Overviews、AI Mode 和 Discover 的生成式 AI 功能中作为链接、内容或 grounding 使用;默认包含。配置变更通常需要数天处理;控制生效后,相关内容通常在 1–2 天内排除,缓存传播可能更久。 该控制不影响站点在普通 Google Search 的总体收录/排名,也不等同于 AI 训练控制。要退出整个 Search 用 noindex;要限制相关模型训练用途参见 Google-Extended。它处于子集 rollout,不能假设所有属性已可见。
SC-15 Generative AI performance report (Search) 未显示;2026-07-13 核验;Google Search Console Help;分批开放 A1 / 中 专门报告 AI Overviews 与 AI Mode 的 impressions,可按 page、country、device、date 查看;Search Labs 不计入。相同数据仍包含在整体 Web Search report 中。 当前专门报告没有 clicks、CTR、average position 或 query 维度;仍受 canonical、隐私、聚合和最多 1,000 行等限制。不能用 impressions 反推被模型引用的具体句子、答案份额或引荐点击。
SC-16 Generative AI performance report (Discover) 未显示;2026-07-13 核验;Google Search Console Help;分批开放 A1 / 中 报告 Discover 生成式 AI 体验中的 impressions,并按 pages、countries、dates 查看;官方定义滚动进入视口后的 impression 计数。 当前无 query、device、click 指标;impression 不是点击、引用质量或生成答案中的可见份额。与常规 Discover 数据也不能随意混算。

Search Console 数据解释的官方边界

  1. 报告是产品化、经过聚合的诊断视图,不是 Google 内部原始日志。 隐私过滤、canonical 归并、属性范围、行数上限和数据延迟都会造成差异。
  2. “位置”不是固定 SERP 排名。 SC-03 定义的是所展示最高结果的位置平均值,实际结果受地点、设备、时间和个性化影响。
  3. Live test 不是预排名器。 SC-06 明确列出它无法判断的质量、canonical、政策和实际索引问题。
  4. 抓取、索引和表现报告必须分开解释。 SC-09 的抓取量不能替代 SC-07 的索引状态,更不能替代 SC-03 的展示数据。

6. AI Search / GEO:Google 当前官方框架

术语说明:Google 2026 官方指南承认行业使用 AEO(answer engine optimization)和 GEO(generative engine optimization)等术语,但明确主张:就 Google Search 的 AI 功能而言,这仍是 SEO。以下只记录 Google 对其自身 Search 产品的陈述,不能自动外推到 ChatGPT、Perplexity、Bing/Copilot、Claude 或其他模型/搜索产品。

6.1 当前主规范与产品说明

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
G-01 Google's Guide to Optimizing for Generative AI Features on Google Search 最后更新 2026-07-10;Google Search Central A1 / 高 当前 Google Search GEO/AEO 主规范。Google 说明 AI Overviews、AI Mode 等根植于 Search 既有排名与质量系统,使用 Search index、grounding / retrieval-augmented generation 和 query fan-out。页面要成为候选来源,需已被索引、可显示 snippet、符合技术要求,并受 Search Console generative AI control 允许。 资格不保证链接、引用、曝光或排名;“使用核心系统”不表示 AI 功能与传统蓝链结果完全相同,也不披露权重、prompt、召回阈值或生成模型细节。指南只覆盖 Google Search。
G-02 AI Features and Your Website 最后更新 2025-12-10;Google Search Central C(部分仍有效)/ 高 说明 AI Overviews / AI Mode 的基础资格仍来自 Google Search 技术要求、索引和 preview controls;无需额外 AI 专用文件或特殊技术要求。 其“只在总体 Web report 中统计”和旧控制说明已被 2026 年专门生成式 AI 控制与报告(SC-14 至 SC-16)扩展/局部取代。当前冲突处以 G-01 和 Search Console 当前帮助页为准。
G-03 Google Search's Guidance on Generative AI Content on Your Website 最后更新 2025-12-10;Google Search Central A1 / 高 AI 辅助创作本身不违反政策;准确性、质量、相关性、metadata/alt/structured data 的准确表达,以及是否提供用户价值仍是核心。 这是“站点用 AI 生产内容”的规则,不是“如何进入 Google AI answer”的独立排名配方;不得曲解为批量生成许可。
G-04 Search generative AI control 未显示;2026-07-13 核验;Google Search Console Help A1 / 中 当前用于允许/禁止站点内容作为 Search AI 链接、内容或 grounding 的属性级控制,覆盖 AI Overviews、AI Mode 和 Discover 生成式 AI 功能。 详见 SC-14。它不控制普通 Search 收录/排名,也不控制所有模型训练。
G-05 Robots Meta Tags Specifications 最后更新 2026-03-24;Google Search Central A1 / 高 nosnippetdata-nosnippetmax-snippet 等可限制 Search 中传统摘要和 AI Overviews / AI Mode 对内容的直接使用;noindex 可退出 Search。 页面级预览控制与 Search Console 的属性级生成式 AI 控制范围不同;也不能由这些指令推出对 Gemini/Vertex 或其他公司模型训练的统一控制。
G-06 Google's common crawlers — Google-Extended 最后更新 2026-04-23;Google A1 / 高 Google-Extended 是用于管理内容是否可用于未来 Gemini 模型训练以及 Gemini Apps / Vertex AI grounding 的独立 robots token;官方明确其设置不影响 Google Search 收录或排名。Search Console 当前帮助页也将它指向“限制用于生成 Search AI 响应的模型训练”的控制。 它没有独立请求 UA,不能按日志寻找“Google-Extended 抓取”;也不是 Search AI 结果中链接、内容或 grounding 的退出开关,后者由 G-04 控制。Google 文档不支持把它当 Google Search 排名信号。

6.2 官方发布与员工署名说明

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
G-07 A new resource for optimizing for generative AI in Google Search 2026-05-15;John Mueller A2 / 高 正式发布 G-01,重申 Google 将 AEO/GEO 视为 Search SEO 的延续,并把官方建议集中到单一资源。 公告不是独立算法文档;当前规则和后续更新以 G-01 为准。
G-08 Introducing Search Generative AI performance reports in Search Console 2026-06-03;Hillel Maoz、Moshe Samet A2 / 高 正式宣布 Search 与 Discover 的生成式 AI 专门 performance reports,并说明分批推出及核心指标范围。 发布时间不表示所有属性当日获得功能;报告口径后续可变,应以 SC-15/SC-16 当前帮助页为准。
G-09 Top ways to ensure your content performs well in Google's AI experiences on Search 2025-05-21;John Mueller C / 高 2025 年员工官方文章强调独特且非商品化内容、良好页面体验、允许抓取/索引、结构化数据与可见内容一致、提供图文视频等多模态信息。 已由 G-01 扩展并更新;不能把文章标题中的“top ways”理解为完整算法或保证。

6.3 官方报告口径

ID 官方标题与 URL 日期 / 署名 层级 / 置信度 可支持的结论 边界与不可推出
G-10 Generative AI performance report (Search) 未显示;2026-07-13 核验 A1 / 中 AI Overviews / AI Mode impressions 的官方第一方报告;可按 page/country/device/date 细分。 当前不提供 query、click、CTR、average position、答案文本或引用位置;不能据此计算传统意义的 CTR 或“share of answer”。
G-11 Generative AI performance report (Discover) 未显示;2026-07-13 核验 A1 / 中 Discover 生成式 AI impression 的官方第一方报告;可按 pages/countries/dates 细分。 当前不提供点击或 query;与 Search AI report 的产品场景和计数方式不同。

6.4 Google 2026 官方明确否认的 GEO 神话

以下结论均由 G-01 直接支持,置信度均为;每条后面列出不能越过的边界。

说法 Google 官方结论 边界
“Google Search 需要 llms.txt Google Search 不使用 llms.txt,也不使用其他所谓 AI 专用文本文件、markup 或 Markdown;添加它们对 Google Search 既无帮助也无伤害。 只证明 Google Search 当前不使用;不能外推其他 AI 产品,也不能保证未来永不改变。
“必须把内容切成固定长度的 chunks” Google 不要求为了 AI Search 把内容切成固定 chunk。 清晰结构仍可帮助人和传统检索理解,但没有官方 chunk 字数阈值。
“必须采用 AI 专用写作风格” 没有 Google AI Search 专用文风;仍应为人写作,清楚、准确、独特、完整。 不表示版式、语言清晰度和查询匹配毫无作用;只是没有特殊机器口令式文风。
“每个长尾/对话式问题都要单独建页” 不需要覆盖 query fan-out 可能生成的每个变体;应避免为大量相似变体批量建低价值页。 不否认不同用户意图确实需要不同实质内容;边界是内容是否独特且有用户价值。
“提到更多品牌/实体名称即可骗取引用” 不真实、无实质内容的 mentions 没有帮助;重点是可验证、相关、真实的信息。 合法的品牌、作者、来源和引用仍可帮助用户理解与验证,但没有 mention 次数公式。
“需要 AI 专用 schema” Google Search 的生成式 AI 功能不要求特殊结构化数据;现有 structured data 也必须与可见内容一致。 现有 schema 仍可能帮助 Google 理解页面并获得相应传统富结果资格,但不是 AI 引用通行证。
“第三方工具能看到 Google 内部 AI visibility / ranking” Google 明确说第三方无法访问其内部 ranking / AI performance 数据;第三方指标是其自己的估计。 不表示第三方监测完全没用;只是不应冒充 Google 官方计量或因果证据。
“生成式 AI 是一套与 SEO 无关的新索引” Google 说明 AI Search 体验以 Search index、核心 ranking/quality systems、grounding/RAG 与 query fan-out 为基础;对 Google Search 来说 GEO/AEO 是 SEO 的延续。 不表示 AI 回答与普通 SERP 使用完全相同的候选集、排序、界面或成功指标。

6.5 三类控制不能混用

想达到的目的 Google 当前官方控制 不会自动做到的事
完全退出 Google Search 页面/资源可抓取地提供 noindex(T-11/T-12/G-05) 不等于删除所有历史缓存或阻止其他 Google 非 Search 产品;生效需重新抓取。
仍在 Search,但限制传统摘要及 AI Overview/AI Mode 直接使用某些文本 nosnippetdata-nosnippetmax-snippet 等预览控制(T-11/G-05) 不等于禁止链接被发现、禁止普通排名、禁止所有模型训练。
不让站点内容作为 Search AI 的链接、内容或 grounding,仍保留普通 Search Search Console Search generative AI control = Exclude(SC-14/G-04) 不影响普通 Search 收录/排名;不等于训练退出。
限制内容用于未来 Gemini 模型训练及指定 Gemini grounding 用途 robots.txt 的 Google-Extended token(T-03/G-06) 不退出普通 Search,也不直接退出 Search AI 的链接/内容/grounding。

7. Google 员工一手公开发言与架构解释

纳入标准:必须有明确员工身份、原始文章/录像、可核对日期和直接 URL。Search Central Office Hours、论坛答复和播客数量庞大且常为具体情境的即兴解释;本台账不把无法稳定定位原句、上下文或时间的二手摘录收进来。下列材料按“当前官方文档优先”的规则使用。

ID 原始标题与 URL 日期 / 发言人 层级 / 置信度 一手材料可支持的结论 边界与不可推出
E-01 Inside Googlebot: demystifying crawling, fetching, and the bytes we process 2026-03-31;Gary Illyes B1 / 高 Googlebot 是 Google 中央抓取平台的 client;当前 Googlebot 对单 URL 抓取上限为含 HTTP headers 的 2 MB,PDF 为 64 MB;没有自行设置限制的 crawler client 默认 15 MB;子资源有独立计数。Web Rendering Service 在请求间清除 local/session storage,属 stateless。 Gary 明确说限制可变。当前 2 MB 说明取代 2022 年“Googlebot 15 MB”的旧说法(针对 Googlebot 本身);不能把字节上限当排名因子,也不能认为超限前所有字节必然索引。
E-02 Crawling December: The how and why of Googlebot crawling 2024-12-03,更新 2024-12-06;Martin Splitt、Gary Illyes B1 / 高 WRS 获取渲染资源,其缓存可最长约 30 天且独立于站点 HTTP cache directives;阻止关键 JS/CSS 资源可能妨碍内容提取。原始服务器访问日志是判断 Google 实际抓取内容的最佳来源,Crawl Stats 是次优的产品化视图。 缓存时长是“可到”而非固定 TTL;日志只证明请求,不证明索引、canonical 或排名。分离关键资源 origin 的性能影响是架构警告,不是排名惩罚声明。
E-03 Introducing INP to Core Web Vitals 2023-05-10;更新 2024-01-31、2024-03-12;Martin Splitt B1 / 高 INP 于 2024-03-12 正式取代 FID 成为 Core Web Vital;文章明确说优秀 CWV 并不保证优秀排名。 博客提示部分信息可能过时;当前 CWV 定义以 Q-10 和 web.dev 当前文档为准。不能从指标替换推导某站排名变化原因。
E-04 Mobile-first indexing has landed - thanks for all your support 2023-10-31;John Mueller、Nir Kalush B1 / 高 Google 宣布移动优先索引 rollout 基本完成;极少数在移动设备完全不可用的旧站仍可能由 legacy desktop crawler 处理。 当前实施要求以 T-26 为准;不能把极小例外当成维持桌面优先站点的策略。
E-05 What site owners should know about Google's August 2019 core update 2019-08-01;Danny Sullivan C / 高 核心更新是广泛重新评估,下降不一定表示违反指南或存在可修复的单一错误;文章以“年度最佳电影榜单更新”解释相对重排。 当前操作指导以 Q-06 为准;类比不是算法机制证明,也不能用来排除技术、政策或竞争变化。
E-06 Evolving “nofollow” – new ways to identify the nature of links 2019-09-10;Danny Sullivan、Gary Illyes C / 高 Google 引入 rel="sponsored"rel="ugc"nofollowsponsoredugc 被视为用于排名的 hints,并自 2020-03-01 起在抓取/索引方面也作为 hints。 “hint”不表示每条此类链接一定被抓取、索引或传递排名信号;不能用 nofollow 作为可靠 noindex。当前链接政策仍以 F-03 与当前文档为准。
E-07 Google Search's guidance about AI-generated content 2023-02-08;Danny Sullivan、Chris Nelson C / 高 Google Search Quality 团队当时明确:AI/自动化本身非禁区,主要为操纵排名而自动生成内容违反政策,AI 没有天然排名特权。 当前以 Q-11 与 F-03 为准;不支持“AI 内容不会受质量系统影响”或“Google 无法识别规模化滥用”。
E-08 How AI powers great search results 2022-02-03;Pandu Nayak,Google Fellow / VP Search B1(历史)/ 中 当时 Google Search 使用数百个算法和机器学习模型,各有专门角色;文章解释 RankBrain、neural matching、BERT 的不同用途,并说明 MUM 当时尚未用于一般排名。 是 2022 架构快照;不能把列出的系统当作 2026 完整清单,也不能据此推导可优化权重。关于 MUM 的“尚未一般排名”是当时状态,后续以 Q-05 为准。
E-09 SMX West 2016 — How Google Works: A Google Ranking Engineer's Story 原始活动录像上传 2016-03-29;Paul Haahr,Google Ranking Engineer;Search Marketing Expo 频道 B2(历史)/ 中 Haahr 亲自解释当时经典网页搜索的简化流程:query understanding、分片检索与打分、后处理中的多样性/去重/垃圾处理,以及 live A/B experiments 与 human raters 在系统评估中的作用。他也说明点击解释困难:好摘要可能让用户无需点击,失败结果也可能触发点击。 非 Google 域名但为原始完整录像;是 2016 “ten blue links”简化架构,不是当前完整系统。发言不能证明“CTR 是直接排名因子”,也不能证明“Google 从不使用任何点击/互动数据”;它只证明点击指标存在强歧义。
E-10 SMX West 2016 — How Google Works Q&A 原始活动录像上传 2016-03-29;Paul Haahr、Gary Illyes;Search Marketing Expo 频道 B2(历史)/ 中 原始问答补充当时 Google 如何思考实验、查询与排名问题,可用于核对两位员工当场具体回答。 Q&A 高度依赖问题上下文且已距今十年;不能把即兴回答提升为 2026 规范,引用时必须保留问题、完整回答与日期。
E-11 Search Quality Raters Guidelines update 2023-11-16;Elizabeth Tucker B1 / 高 Google Search Quality 团队成员明确区分 rater evaluation 与 live ranking,并解释指南更新目的。 不披露评分员抽样规模、内部统计阈值或具体模型训练方式;不能由指南变化反推排名因子权重。
E-12 Top ways to ensure your content performs well in Google's AI experiences on Search 2025-05-21;John Mueller C / 高 Google 员工在官方渠道公开给出 AI Search 站点原则,证明 2025 年官方把 AI 搜索优化建立在既有 SEO、内容质量、页面体验与可访问性之上。 当前完整规范为 G-01;旧文没有 2026 新的 Search Console 控制、专门报告和 llms.txt 等明确澄清。

员工发言的引用纪律

  • 引用时至少保留:发言人、职位/身份、原始 URL、日期、完整上下文、是否已被当前文档更新。
  • “Google 员工说过”不等于“Google 当前政策规定”。B1/B2 材料必须与 A1 当前文档对照。
  • 员工说“可能”“通常”“我们看到”时,不得改写成“必然”“权重为”“Google 已确认排名因子”。
  • YouTube 原始录像可证明发言本身,不证明字幕、第三方时间戳摘要或媒体标题的准确性;关键结论应回看片段上下文。

8. 版本演进与冲突处理矩阵

主题 较旧的一手材料 当前有效状态 应如何引用
Googlebot 单 URL 抓取字节上限 2022 年 Google 官方文章曾广泛表述 Googlebot 处理前 15 MB E-01(2026-03-31)明确:当前 Googlebot 2 MB(含 headers),PDF 64 MB;未设置自身限制的 crawler clients 默认 15 MB 针对当前 Googlebot 只能引 E-01;旧 15 MB 可作为历史,不得当现行上限
Helpful Content system 旧公告将其描述为独立系统/更新 Q-05 明确:2024-03 并入核心排名系统 不再把 2024-03 之后的变化称为独立 Helpful Content Update,除非 Google 官方如此命名
Core Web Vitals 交互指标 FID 曾是 CWV E-03:INP 于 2024-03-12 取代 FID;Q-10 是当前规范 当前评估引用 INP;FID 仅用于历史分析
Mobile-first indexing rollout 多年间处于分批迁移 E-04 宣布 2023 年 rollout 基本完成;T-26 是当前实施规范 不再以“等待被迁移”解释大多数站点;极小 legacy 例外不能普遍化
nofollow 语义 早期常被理解为不跟随/不计入的命令 E-06:排名上作为 hint;2020-03-01 起抓取/索引方面也作为 hint 不能把 nofollownoindex 或绝对不抓取保证
FAQ / HowTo rich results 过去有普遍功能文档 SD-16:FAQ 限制到知名权威政府/健康站;HowTo rich result 退役;FAQ 旧指南当前重定向 不应向一般网站承诺 FAQ/HowTo rich result;保留 markup 不等于普通排名有益
AI Search 报告 G-02(2025)说明 AI 流量计入总体 Web report,没有专门拆分 SC-15/SC-16 与 G-08(2026)新增专门 Search/Discover generative AI impression reports 2026 当前以帮助页口径为准;总体 Web report 仍包含相关数据,但已有专门视图
Search AI 退出控制 早期主要靠 snippet controls / noindex SC-14/G-04(2026)增加属性级 generative AI Include/Exclude/Inherit 区分普通 Search、Search AI 展示/grounding、snippet 和模型训练四种控制
Google-Extended 早期主要围绕 Bard/Gemini 训练用途解释 T-03/G-06 当前覆盖未来 Gemini 模型训练及 Gemini Apps/Vertex grounding;Search Console 帮助页另提模型训练关联 不得把 Google-Extended 当 Search AI 展示退出开关或 Search 排名信号
AI/GEO 基础指南 G-09(2025)与 G-02 是早期官方原则 G-01 最后更新 2026-07-10,是当前主规范 当前结论优先引用 G-01;旧文只用于证明政策连续性/演进

冲突裁决规则

  1. 同一主题:A1 当前文档 > A2 发布公告 > B1 员工官方解释 > B2 外部原始演讲 > C 历史材料。
  2. 若官方页面互相看似冲突,先检查更新时间与适用产品。 例如 Google-Extended 面向模型训练/指定 grounding,而 Search generative AI control 面向 Google Search AI 展示与 grounding,两者不是同一作用域。
  3. 旧材料没有被删除,不代表仍完整有效。 Google 官方博客常保留历史页面;文章页自己的警告、当前文档和 changelog 优先。
  4. “没有官方证据”不等于“确定没有”。 对未披露算法、权重、点击数据用途等,只能写“本组官方材料不能证明”,不能反向断言不存在。

9. 按命题检索:官方材料能证明到哪一步

待验证命题 直接证据 证据支持的最强安全表述 官方证据不能支持的升级版说法
Google Search 有哪些最低技术资格? F-02 Googlebot 未被阻止、成功 HTTP 响应、可索引内容是最低资格;仍不保证索引 “满足三项就一定被收录/排名”
robots.txt 能否删除搜索结果? T-09 至 T-12 robots.txt 管抓取;可靠退出索引用可抓取的 noindex “Disallow 等于 noindex”
Sitemap 是否提升排名? T-13/T-14 Sitemap 帮助发现 URL,并提供弱 canonical 线索 “提交 sitemap 会提高排名或保证索引”
canonical 是否是强制命令? T-15/T-16 redirect 和 rel=canonical 是强信号,Google 仍可选其他 canonical “Google 必须服从 canonical 标签”
Google 能否处理 JavaScript? T-22 至 T-25、E-02 Google 能渲染现代 JS,但有排队、资源、错误和缓存边界;SSR/静态渲染更稳健 “Google 与浏览器用户永远看到完全相同且即时的 JS 内容”
移动版是否决定索引? T-26/E-04 Google 主要用移动版内容索引与排名,关键内容与 metadata 应等价 “响应式设计本身是排名加分项”
是否存在固定最佳字数? Q-01 Google 明确否认偏好某个字数;应以完整、原创、对用户有价值为目标 “Google 偏好 1,500/2,000/3,000 字”
E-E-A-T 是否是一个分数/单因子? Q-01/Q-02 Google 使用多种信号识别与 E-E-A-T 一致的内容;Trust 最重要,YMYL 更强调 “存在可在工具中读取的 E-E-A-T 分,或作者 schema 直接提高它”
质量评估员是否直接改排名? Q-02 至 Q-04、E-11 评分用于衡量系统表现、支持改进,不直接改变某页/某站排名 “被评分员打低分后网站被人工降权”
Core Web Vitals 是否用于排名? Q-09/Q-10/E-03 CWV 被排名系统使用,是整体页面体验的一部分;好分数不保证高排名 “Lighthouse 100 分保证排名,或每提升 1 分线性提升位置”
AI 内容是否一律违规? Q-11/Q-12/F-03 AI 本身不违规;主要为操纵排名而规模化生成低价值内容可违反 spam policies “Google 自动惩罚所有 AI 内容”或“AI 内容完全无风险”
结构化数据是否提高普通排名? SD-01 至 SD-03 帮助理解页面并使页面有资格获得受支持搜索外观 “验证通过就有 rich result/排名提升”
第三方 SEO 指标是否是 Google 指标? Q-08/G-01 第三方无权访问 Google 内部排名/AI 表现数据,其指标是外部估算 “DR/DA/AI visibility 是 Google 使用或认可的分数”
Google 是否直接使用 CTR 排名? E-09(另需 DOJ/内部证据台账) Haahr 2016 只证明点击解释有歧义,不能据此确认或否认当前具体用途 “CTR 已被官方确认是直接因子”或“Google 从不使用任何点击数据”
Google AI Search 是否需要 llms.txt G-01 Google Search 当前忽略 llms.txt 和 AI 专用文本/markup “所有 AI 引擎都忽略”或“未来永不使用”
Google AI Search 是否需要特殊 schema/chunking? G-01 不需要 AI 专用 schema,也没有固定 chunk 要求 “现有结构化数据和清晰结构完全无用”
GEO 是否独立于 SEO? G-01/G-07 Google 称其 Search AI 功能以 Search index、核心 ranking/quality systems 和 grounding 为基础;对 Google Search 而言 GEO/AEO 是 SEO 的延续 “AI answer 与传统结果使用完全相同排序/权重”
如何查看 Google AI Search 表现? SC-15/SC-16/G-08 当前专门报告提供 impressions 与有限维度;总体 Web report 也包含 Search AI 数据 “可看到 query、click、答案引用位置、模型 prompt 或完整 referral”
如何退出 Google Search AI 但保留普通 Search? SC-14/G-04 使用属性级 Search generative AI control 的 Exclude “Google-Extended、robots.txt Disallow 或 nosnippet 与该控制完全等价”

10. 官方来源入口与持续维护

入口 URL 用途 注意事项
Google Search Central documentation https://developers.google.com/search/docs 当前 Search 技术、内容、外观、监控文档总入口 具体结论应链接到具体文档,不用总入口替代证据
Google Search Central documentation updates https://developers.google.com/search/updates 跟踪新增、修改、弃用和迁移的文档/功能 更新日志说明“文档变了”,不必然等于同日算法上线
Google Search Central Blog https://developers.google.com/search/blog 官方公告、员工署名解释和产品更新 旧文长期保留;必须检查日期与是否被当前文档取代
Google Search Console Help https://support.google.com/webmasters/ 当前 Search Console 界面、指标和控制说明 多数页不显示更新时间;保留核验日期
Google Search Status Dashboard https://status.search.google.com/ 核对排名更新和 Search 系统事件的官方时间 不能证明单站因果
Search Quality Evaluator Guidelines 当前公开 PDF 当前质量评估概念与示例 PDF URL 可能不变而内容版本更新;记录封面日期与页数
Google crawler/fetcher documentation https://developers.google.com/crawling/docs/crawlers-fetchers/overview-google-crawlers Search 以外也适用的 Google 爬虫、token、DNS 验证 区分 common、special-case、user-triggered 与 robots token

建议的复核周期(仅针对证据维护,不是 SEO 建议)

  • 每次引用前复核 G-01、F-03、SD-02/SD-03、SC-14 至 SC-16,因为这些页面在 2026 年仍频繁更新。
  • 每月检查 Search Central documentation updates 与 Search Status Dashboard。
  • 每次 Search Console UI 或报告字段变化时,重新保存帮助页标题、可用指标、维度、限制和核验日。
  • 每次引用员工旧发言时,先检索当前 Search Central 文档是否已有相反或更精确说明。

11. 本台账的结论强度与未覆盖项

高置信度结论

  1. Google 当前公开的 SEO 基础仍是可抓取/可索引、符合 spam policies、提供面向用户且可靠的内容,以及让 Google 能理解页面和站点结构。
  2. 技术合规、结构化数据验证、Search Console 提交、优秀 CWV 都只解决各自层面的资格或质量问题;任何一项都不保证索引、富结果或高排名。
  3. Google 2026 年对其 Search AI 功能的官方立场是:GEO/AEO 属于 SEO 的延续;AI 功能建立在 Search index、既有排名/质量系统、grounding/RAG 与 query fan-out 上。
  4. Google Search 当前不使用 llms.txt、AI 专用 markup、固定 chunk 或 AI 专用 schema;没有官方“AI 文风”或批量长尾页面公式。
  5. Search AI 展示/grounding、搜索摘要、普通 Search 收录和 Gemini 相关模型训练分别有不同控制,不能互换。
  6. Search Console 是经过聚合和限制的官方诊断数据,不是内部排名日志;当前生成式 AI 专门报告主要提供 impressions,不能直接给出答案引用率或 query/click 明细。

本组来源不能单独证明的事项

  • 精确排名因子总表、权重、阈值、特征名、模型架构和每次更新的全部改变。
  • 点击、停留、Chrome 数据、Navboost 等信号在当前每类查询中的精确用途和权重;这些需单独审查 DOJ 原始证词/庭审文件,不能靠 E-09 的旧演讲做肯定或否定。
  • Google 专利中的方法是否已在生产部署、何时部署、以何权重部署;“拥有专利”不等于“当前使用”。
  • 第三方 AI 引擎的抓取、训练、引用和排名规则;本台账只覆盖 Google 自己的公开陈述。
  • 单个网站流量变化的因果;即使时间与某次更新重合,也需结合站点日志、Search Console、部署记录、竞争与需求变化验证。

完整性声明

本台账覆盖了建立 Google SEO/GEO 官方证据框架所需的主规范、关键技术分支、内容质量与质量评估、结构化数据总则及代表性功能、Search Console 核心报告、2026 Search AI 控制与报告,以及高价值员工一手公开解释。它不是对 Search Central 每一个垂直功能页(例如所有招聘、食谱、活动、航班、酒店或本地业务 feature guide)的逐页镜像;这些垂直功能的当前完整清单由 SD-03 Search Gallery 作为权威目录。任何垂直行业结论都应在引用时再加入对应 feature-specific guide,而不能只依赖通用 structured data 规则。

附录 B|Google 搜索与生成式搜索专利证据矩阵

更新时间:2026-07-13
来源范围:仅采用专利原文及 Google Patents 页面元数据。未采用第三方 SEO/GEO 教程、专利解读文章或行业传言。

证据使用规则

本文件中的“当前状态”只复述 Google Patents 页面显示的状态。Google Patents 在每个页面均明确说明:其法律状态是推定信息,并非法律结论,Google 不保证状态准确。

专利能够证明的是:权利人和发明人在特定时间披露、申请并在部分案件中获得了对某种技术组合的保护。专利本身不能证明:

  • 该技术已在 Google Search 生产环境部署;
  • 该技术目前仍在运行;
  • 它适用于所有查询、国家、语言、搜索垂类或生成式搜索界面;
  • 说明书中的所有可选特征都被实际采用;
  • 说明书示例中的数值、阈值或公式是生产参数;
  • 某个信号的当前权重;
  • 网站复现专利输入即可获得排名、摘要展示或来源引用;
  • 同一 continuation、divisional 或 continuation-in-part 家族中的多件专利构成多份独立产品证据。

以下每组均区分“专利披露的机制”“可支持结论”和“不可外推边界”。


1. US6285999B1 — Method for node ranking in a linked database

  • Google Patents: US6285999B1
  • 优先权日: 1997-01-10
  • 申请日: 1998-01-09
  • 授权/公开日: 2001-09-04
  • Google Patents 当前状态: Expired - Lifetime
  • 发明人: Lawrence Page
  • 受让人: 原始受让人为 Leland Stanford Junior University;Google Patents 当前受让人栏列 Google LLC 与 Leland Stanford Junior University

专利披露的机制

  • 以有向链接图表示文档和文档间的引用关系。
  • 文档的重要性取决于指向该文档的其他文档的重要性,而不是简单计算入链数量。
  • 通过迭代计算获得近似稳态分布。
  • 以随机浏览者在链接间移动并以一定概率跳转到其他节点解释排名。
  • 权利要求 10–11涉及随机遍历和跳转;权利要求 15–16涉及文本匹配和锚文本;权利要求 20 以后涉及反向链接、链接权重和查询无关的迭代分数。

可支持结论

  • Google 的基础搜索技术历史上明确包含链接图和查询无关重要性评价,而不是只依据页面关键词。
  • 在该专利方案中,来自重要文档的引用比来自低重要性文档的引用更有分量。
  • 链接图重要性可以与文本匹配、标题或锚文本等信号组合。

不可外推边界

  • 不能证明当前 Google Search 仍使用原始 PageRank 公式。
  • 不能证明所有链接等权、PageRank 是当前最重要信号,或公开工具中的任何 PageRank 类指标等于 Google 内部分数。
  • 说明书中关于链接位置、字体、新近程度和真实使用数据的可选实施方式,不证明这些特征全部在生产环境采用。

2. US8117209B1 — Ranking documents based on user behavior and/or feature data

  • Google Patents: US8117209B1
  • 优先权日: 2004-06-17
  • 申请日: 2010-03-19
  • 授权/公开日: 2012-02-14
  • Google Patents 当前状态: Expired - Fee Related
  • 发明人: Jeffrey A. Dean、Corin Anderson、Alexis Battle
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1以用户选择和未选择的链接数据及链接特征训练模型。
  • 权利要求 6允许利用模型为链接分配权重。
  • 权利要求 7允许根据链接权重对目标文档排名。
  • 权利要求 13–15涉及正负样本及模型更新。
  • 说明书列举的候选链接特征包括锚文本、字体、页面位置、周边文本、页面和目标主题、链接类型、上下文和商业性质等。

可支持结论

  • Google 获得过一种“不同链接可有不同被选择概率和权重”的专利。
  • 在该披露中,链接的位置、语境、主题和真实用户选择倾向可以比裸链接数量更有意义。

不可外推边界

  • 说明书列举一个特征,不等于 Google 当前使用该特征。
  • 不能据此给正文、导航、页脚或广告链接分配固定 SEO 权重。
  • 不能证明真实点击某个外链会直接提高目标页面排名。

3. US9165040B1 / US9953049B1 — Producing a ranking for pages using distances in a web-link graph

  • Google Patents: US9165040B1US9953049B1
  • 家族优先权日: 2006-10-12
  • US9165040B1 申请日: 2006-10-12
  • US9165040B1 授权/公开日: 2015-10-20
  • Google Patents 当前状态: Active;US9953049B1 为相关 continuation
  • 发明人: Nissan Hajaj
  • 受让人: Google LLC

专利披露的机制

  • 选择一组种子页面,并计算待排名页面到种子页面的最短或第 k 短链接距离。
  • 以该距离生成相对质量或排序分数。
  • 说明书描述种子可为高质量、可靠、多样且链接良好的页面,并讨论人工选择种子时的操纵风险。
  • US9953049B1 的权利要求明确将基于种子距离得到的分数用于响应搜索查询的结果排名。

可支持结论

  • Google 保护过一种以高质量种子和链接图距离评价页面相对质量的方案。
  • 链接质量在技术上可以表现为图路径、来源和距离,而不只是链接数量。

不可外推边界

  • 不能证明 Google 当前运行所谓 TrustRank,也不能确定种子页面名单。
  • 不能推导 .edu.gov 或新闻站点具有自动特权。
  • 不能将任何固定跳数解释为当前排名阈值。

4. US7509344B1 — Method for detecting link spam in hyperlinked databases

  • Google Patents: US7509344B1
  • 优先权日: 2003-08-18
  • 申请日: 2004-08-18
  • 授权/公开日: 2009-03-24
  • Google Patents 当前状态: Expired - Lifetime
  • 发明人: Sepandar D. Kamvar、Taher H. Haveliwala、Glen M. Jeh
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1计算节点重要性函数导数的相关量,将其与阈值比较,并识别可能从人为抬高重要性的链接中获益的节点。
  • 说明书将相关模块描述为可位于 page ranker 或 page-importance ranking subsystem 中。
  • 披露的动作包括调整节点重要性、删除节点,或根据归一化值重新排序结果。

可支持结论

  • Google 很早就研究并申请保护了从链接图数学性质识别人为链接膨胀的技术。
  • 大量链接与可信、自然产生的图结构支持并不是同一概念。

不可外推边界

  • 不能证明该导数方法目前仍在运行。
  • 不能从链接增长突然直接推断 Google 会惩罚页面。
  • 不能反推出当前反垃圾阈值或绕过方法。

5. US9002832B1 — Classifying sites as low quality sites

  • Google Patents: US9002832B1
  • 优先权/申请日: 2012-06-04
  • 授权/公开日: 2015-04-07
  • Google Patents 当前状态: Active
  • 发明人: Rajan Patel、Zhihuan Qiu、Chung Tin Kwok
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1取得指向某站点的多个来源资源的质量分,将来源分配到不同质量组,并根据各组数量和权重计算站点 link-quality score。
  • 当分数低于阈值时,可把站点分类为低质量。
  • 权利要求 2允许因低质量分类而降低搜索结果排名分数。
  • 权利要求 4–7允许排除 boilerplate 中的链接,并对同一站点或相同内容上下文的多个来源做多样性过滤。

可支持结论

  • Google 获得过根据入链来源质量分布和独立性识别低质量站点的专利。
  • 在该方案中,重复、模板化、同站或同上下文的链接可以被去重或降低统计影响。

不可外推边界

  • 说明书中的 vital/good/bad 分组、权重和阈值不是已确认的生产参数。
  • 不能推断所有 boilerplate 或页脚链接都完全无价值。
  • 不能证明该具体分类器目前仍用于 Google Search。

6. US7260573B1 — Personalizing anchor text scores in a search engine

  • Google Patents: US7260573B1
  • 优先权/申请日: 2004-05-17
  • 授权/公开日: 2007-08-21
  • Google Patents 当前状态: Expired - Lifetime
  • 发明人: Glen Jeh、Taher H. Haveliwala、Sepandar D. Kamvar
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1–15组合文档的信息检索分数、指向目标文档的来源文档、来源文档中满足查询的锚文本及来源文档的个性化重要性分。
  • 对来源贡献进行累积,得到目标文档的个性化 anchor score。
  • 说明书描述从锚文本映射到目标文档的反向锚文本索引。

可支持结论

  • 锚文本在该专利系统中可以为目标页面提供其自身正文之外的查询相关描述。
  • 锚文本来源页面的重要性可以参与目标文档分数。

不可外推边界

  • 不能证明当前 Google 使用该个性化 anchor 公式。
  • 不能推断完全匹配锚文本越多越好。
  • 不能证明外部锚文本可以替代目标页面自身的内容质量和相关性。

7. US7536408B2 / US9990421B2 — Phrase-based indexing/searching

  • Google Patents: US7536408B2US9990421B2
  • 家族优先权日: 2004-07-26
  • US7536408B2 申请日: 2004-07-26
  • 授权/公开日: 2009-05-19;相关 continuation US9990421B2 于 2018-06-05 授权
  • Google Patents 当前状态: 两件页面均显示 Expired - Lifetime
  • 发明人: Anna Lynn Patterson / Anna L. Patterson
  • 受让人: Google LLC

专利披露的机制

  • US7536408B2 权利要求 1根据短语的实际共现率与预期共现率之间的信息增益识别 related phrases,并把文档和相关短语信息写入 posting list。
  • 其权利要求 7涉及根据短语和相关短语识别主要及次要主题;权利要求 8涉及锚文本和相关短语 link score。
  • US9990421B2 权利要求 1按文档包含的相关短语数量排名。
  • 其权利要求 3允许查询词频较低、但包含多个相关短语的文档超过查询词频较高而没有相关短语的文档;权利要求 5允许召回不含原短语但含相关短语的文档。

可支持结论

  • Google 获得过基于多词短语、统计共现和信息增益进行索引及搜索的专利。
  • 在所披露系统中,主题相关性不等同于查询词重复次数。

不可外推边界

  • 专利未证明任何第三方“语义词”或所谓 LSI 关键词列表等于 Google 的 phrase index。
  • 不能从专利反推出相关短语的当前阈值、列表或页面覆盖率目标。
  • 同家族的多件 continuation 不是多份独立产品确认。

8. US8078629B2 — Detecting spam documents in a phrase based information retrieval system

  • Google Patents: US8078629B2
  • 家族优先权日: 2004-07-26
  • 申请日: 2009-10-13
  • 授权/公开日: 2011-12-13
  • Google Patents 当前状态: Active
  • 发明人: Anna Lynn Patterson
  • 受让人: Google LLC

专利披露的机制

  • 对文档中的核心短语估计正常语料下应出现的相关短语数量。
  • 统计文档实际出现的相关短语数量。
  • 当实际数量显著高于预期时,可把文档判为 spam。
  • 权利要求允许把文档加入 spam list,并在查询时降低相关性分数或将其排除。
  • 从属权利要求包含以标准差、倍数或多个主要短语判断异常的实施方式。

可支持结论

  • Google 保护过将“异常过量的相关短语”视为垃圾信号的技术。
  • 自然主题覆盖与机械堆积相关短语在该披露中并非同一行为。

不可外推边界

  • 标准差、倍数和示例数量不是当前 Google Search 的公开阈值。
  • 不能使用第三方词频工具反推 Google 的安全密度。
  • 不能证明该特定 phrase-spam 系统当前仍在生产使用。

9. US7346839B2 — Information retrieval based on historical data

  • Google Patents: US7346839B2
  • 优先权日: 2003-09-30
  • 申请日: 2003-12-31
  • 授权/公开日: 2008-03-18
  • Google Patents 当前状态: Expired - Lifetime
  • 发明人: Anurag Acharya、Matt Cutts、Jeffrey Dean、Paul Haahr、Monika Henzinger、Urs Hölzle、Steve Lawrence、Karl Pfleger、Olcan Sercinoglu、Simon Tong
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1覆盖至少两类历史数据的组合,包括文档 inception、内容变化、查询、链接、锚文本、流量、用户、域名、排名、书签、独立 peer 和主题变化。
  • 权利要求 6–14涉及内容变化频率、变化量和页面区域加权。
  • 权利要求 15–21涉及查询选择趋势以及查询对新内容或旧内容的不同偏好。
  • 权利要求 22–33涉及链接和锚文本历史;34–47涉及流量、用户行为、域名、排名和书签;48–50涉及独立增长及主题变化;54–56涉及链接年龄、持续时间和来源文档更新情况。
  • 说明书讨论链接或锚文本增长是否异常尖锐、是否来自独立来源,以及文档是否突然改变主题。

可支持结论

  • Google 获得过对文档、链接、锚文本和用户需求随时间变化进行建模的专利。
  • 该专利明确允许不同查询偏好新内容或旧内容,因此“新鲜度”不是统一的越新越好。
  • 自然增长和异常突发增长在技术上可以被区分。

不可外推边界

  • 不能把权利要求列举项当作当前 Google 排名因子清单。
  • “至少两类历史数据”不等于每次排名同时使用所有类别。
  • 不能推断修改发布日期、定期改几个字、域名年龄或老链接固定衰减会产生特定排名结果。

10. US7627613B1 — Duplicate document detection in a web crawler system

  • Google Patents: US7627613B1
  • 优先权/申请日: 2003-07-03
  • 授权/公开日: 2009-12-01
  • Google Patents 当前状态: Expired - Fee Related
  • 发明人: Daniel Dulitz、Alexandre A. Verstak、Sanjay Ghemawat、Jeffrey A. Dean
  • 受让人: Google LLC

专利披露的机制

  • 使用内容和 URL 等 fingerprint 识别重复或等价文档。
  • 将重复文档组织成 equivalence class。
  • 说明书允许使用 PageRank 或其他查询无关分数选择代表文档或 canonical。
  • 可使用 hysteresis 避免代表文档在重新计算时频繁切换。
  • 指向非代表副本的锚文本可以合并到代表文档。

可支持结论

  • Google 保护过在抓取和索引流程中聚类重复文档、选择代表 URL 并归并部分信号的技术。
  • 重复 URL 的技术风险可以表现为抓取浪费、索引信号分散和搜索引擎选择不同代表,而不必然是惩罚。

不可外推边界

  • 不能证明当前 Google 只按 PageRank 选择 canonical。
  • 不能证明 rel=canonical 是唯一决定因素。
  • 不能把所有重复内容直接解释为排名处罚。

11. US8442984B1 — Website quality signal generation

  • Google Patents: US8442984B1
  • 优先权/申请日: 2008-03-31
  • 授权/公开日: 2013-05-14
  • Google Patents 当前状态: Active
  • 发明人: Christopher C. Pennock、Jeremy Hylton、Corinna Cortes
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1先计算网站初始质量分,再按指定质量分布选择网站供人工评价。
  • 收集人工对整个网站的质量评分,把评分与 website signals 关联,训练机器学习模型,并应用于未被人工评分的网站。
  • 权利要求 2–3允许按计算出的质量分过滤或排序结果。
  • 权利要求 8明确一个实施对象可以是 blogs;权利要求 10涉及支持向量机。
  • 说明书示例包括原创论点或信息、原创与复制内容比例、布局、语法、页面是否完整、PageRank、点击率和博客订阅率。

可支持结论

  • Google 获得过“以人工质量评价作为监督标签,训练自动网站质量模型”的专利。
  • 该技术路径允许人工评价影响模型训练,而不是要求评价员直接逐站调排名。

不可外推边界

  • 不能证明当前 Search Quality Rater 的单次评价直接改变被评网站排名。
  • 不能把说明书中的博客、Google Reader、订阅率或其他示例当作当前生产特征。
  • 不能证明该专利就是现代 core update 或任何指定算法更新。

12. US9195944B1 — Scoring site quality

  • Google Patents: US9195944B1
  • 优先权日: 2012-02-24
  • 申请日: 2013-02-25
  • 授权/公开日: 2015-11-24
  • Google Patents 当前状态: Active
  • 发明人: Vladimir Ofitserov
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1收集多个用户访问同一站点多个资源的时长。
  • 时长被定义为用户点击搜索结果到返回搜索结果页之间的间隔。
  • 从这些测量中计算集中趋势统计量并得到 site quality score。
  • 从属权利要求允许数据来自用户设备、网络监控或托管服务器;可丢弃过短值、对过长值封顶、按资源类型加权并过滤可疑测量。

可支持结论

  • Google 获得过将 click-to-return 时长聚合为站点级质量分的专利。
  • 所披露系统不是简单读取单次停留时间,而是考虑多个页面、统计聚合、页面类型、极值和异常行为。

不可外推边界

  • 不能证明 Google Analytics 的 bounce rate 或 dwell time 直接进入排名。
  • 不能推断短访问必然负面或不返回 SERP 必然正面。
  • 不能证明强制停留、分页或交互阻碍能提高搜索质量分。

13. US9760641B1 — Site quality score

  • Google Patents: US9760641B1
  • 优先权日: 2012-01-05
  • 申请日: 2015-05-11
  • 授权/公开日: 2017-09-12
  • Google Patents 当前状态: Active
  • 发明人: April R. Lehman、Navneet Panda
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1以被分类为指向特定站点的 textually unique queries 数量为分子函数。
  • 以与该站点资源相关联的 textually unique queries 数量为分母函数。
  • 通过两者比值确定 site quality score,并将其用于结果排名。
  • 权利要求 2允许通过查询后的结果选择把查询与站点关联;权利要求 3明确站点分可作为站内资源排名计算的一项。
  • 权利要求 8–10涵盖 site: 式标签、被识别为指向站点的术语和导航查询。

可支持结论

  • Google 保护过把“用户主动寻找某站点的查询需求”与“该站点参与的整体查询集合”进行比例化的站点级评分机制。
  • 在该技术中,品牌式或导航式需求与站点的广泛查询覆盖不是同一个计数。

不可外推边界

  • 不能把该机制简化为“品牌搜索量越大排名越高”。
  • 不能证明购买或制造品牌搜索会提高排名。
  • 发明人包含 Navneet Panda,不证明该专利就是 Google 产品中的 Panda 或 Navboost。

14. US8682892B1 — Ranking search results

  • Google Patents: US8682892B1
  • 优先权/申请日: 2012-09-28
  • 授权/公开日: 2014-03-25
  • Google Patents 当前状态: Expired - Fee Related
  • 发明人: Navneet Panda、Vladimir Ofitserov
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1按资源组统计 independent incoming links 和 reference queries,并基于两者生成 group-specific modification factor。
  • 权利要求 2–3允许用该因子调整响应实际查询的搜索结果初始分数并重排结果。
  • 说明书允许按是否同组、是否同一所有者、内容/图片/CSS 是否相似等判断来源独立性。
  • 同一来源组的多个链接可以只保留一个代表。
  • reference query 可包括域名、站点指向术语、导航查询,并可按独立用户计数。

可支持结论

  • Google 获得过同时考虑独立外部引用和用户主动寻找站点需求的站点级排名修正专利。
  • 大量表面不同但同所有者或高度相似的来源,可以在该披露中不被视为独立认可。

不可外推边界

  • 不能证明无链接品牌提及当前传递排名价值。
  • 不能把说明书中的比例或归一化方法当作生产公式。
  • 发明人名称不能证明该专利就是 Panda 产品算法。

15. US8661029B1 / US8938463B1 — Modifying search result ranking based on implicit user feedback

  • Google Patents: US8661029B1US8938463B1
  • 家族优先权日: 2006-11-02
  • US8661029B1 申请日: 2006-11-02
  • 授权/公开日: US8661029B1 于 2014-02-25;US8938463B1 于 2015-01-20
  • Google Patents 当前状态: US8661029B1 页面显示 Active
  • 发明人: Hyung-Jin Kim、Simon Tong、Noam M. Shazeer、Michelangelo Diligenti
  • 受让人: Google LLC

专利披露的机制

  • US8661029B1 权利要求 1以某查询下结果文档被选择后的访问子集和总访问数生成相关性测量,并将其提供给排名引擎。
  • 权利要求 3–10涉及按访问时长、查询类别和用户类型加权,以及 long-click/total-click 类比值。
  • 说明书允许记录查询、文档、访问时间、语言、国家、展示未点击、点击位置、标题、snippet、cookie、IP 和 user agent,并过滤异常行为。
  • US8938463B1 权利要求 1使用结果位置、标题、snippet 等 presentation-bias features 与相关性特征训练点击率模型,并从质量分中剥离展示偏差。

可支持结论

  • Google 拥有明确覆盖点击、访问时长、查询—文档关系和展示偏差校正的专利权利要求。
  • 所披露技术并不是简单的裸 CTR,而是允许查询归一化、时长、用户/查询类别、异常过滤和 presentation-bias 模型。

不可外推边界

  • 专利单独不能证明这些信号当前用于 Google Search,也不能证明生产系统名称为 Navboost 或 Glue。
  • 不能证明 CTR 是线性直接排名因子。
  • 不能证明所谓 pogo-sticking 是 Google 官方排名因子名称,也不能推导出可通过刷点击操纵排名。

16. US8046371B2 — Scoring local search results based on location prominence

  • Google Patents: US8046371B2
  • 优先权日: 2005-05-27
  • 申请日: 2010-09-29
  • 授权/公开日: 2011-10-25
  • Google Patents 当前状态: Expired - Lifetime
  • 发明人: Brian O’Clair、Daniel Egnor、Lawrence E. Greenfield
  • 受让人: Google LLC

专利披露的机制

  • 在查询相关性和距离之外计算 location prominence。
  • 权利要求 1及 4–14涵盖以权威文档分数、提及地点或商家的文档数量、最高提及文档分数、评论数量或分数等确定 prominence。
  • 说明书还列举评论语言或类型、用户选择、路线请求、商家存在时长及其他商业数据,并允许机器学习组合。

可支持结论

  • Google 获得过本地搜索不只按距离,而将现实世界 prominence 与查询、位置结合的专利。
  • 网页提及、评论和用户行为在该披露中可以成为地点 prominence 的候选输入。

不可外推边界

  • 不能给评论数、星级、路线请求或商家年龄分配当前固定权重。
  • 不能证明制造评论、点击或路线请求能提高 Local Pack 排名。
  • 该专利不是当前本地搜索完整算法说明。

17. US10235423B2 — Ranking search results based on entity metrics

  • Google Patents: US10235423B2
  • 优先权/申请日: 2012-12-12
  • 授权/公开日: 2019-03-19
  • Google Patents 当前状态: Active
  • 发明人: Hongda Shen、David Francois Huynh、Grace Chung、Chen Zhou、Yanlai Huang、Guanghua Li
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1从知识图谱取得多个实体搜索结果及查询无关 entity metric。
  • 根据实体类型为不同指标应用不同权重,再对实体结果排名。
  • 权利要求 3–6涉及 relatedness、notable entity type、contribution 和 prize metrics。
  • 说明书把实体/类型共现、全局受欢迎程度、评论、知名度榜单和奖项作为可能实现。

可支持结论

  • Google 获得过按实体、实体类型和结构化指标而非只按字符串排序结果的专利。
  • 同一指标可以因实体类型不同而使用不同权重。

不可外推边界

  • 不能证明添加 sameAsPersonOrganization schema 会直接提高 entity score。
  • 不能证明知识面板存在会提高普通网页排名。
  • 说明书示例 metrics 不是当前生产指标清单。

18. US9940367B1 — Scoring candidate answer passages

  • Google Patents: US9940367B1
  • 优先权日: 2014-08-13
  • 申请日: 2015-08-12
  • 授权/公开日: 2018-04-10
  • Google Patents 当前状态: Active
  • 发明人: Steven D. Baker、Srinivasan Venkatachary、Robert Andrew Brennan、Per Bjornsson、Yi Liu、Hadar Shemtov、Massimiliano Ciaramita、Ioannis Tsochantaridis
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1接收被识别为问题的查询及已经排序的响应资源。
  • 从 top-ranked subset 的内容生成候选答案段落。
  • 候选可以由句子或表格单元等 passage units 构成。
  • 计算 query-term match、answer-term match 等分数并选择答案段落。
  • 答案段落可以与识别资源的普通搜索结果分开呈现。

可支持结论

  • 在该专利方案中,传统相关资源检索和排序是答案段落提取的上游。
  • “页面与查询相关”与“页面中的具体段落适合回答问题”可以是不同评分层次。

不可外推边界

  • 不能证明当前 Featured Snippet 或 AI Overview 必须从自然排名前固定 N 个结果中选择。
  • 不能反推出 N 的数值、段落最佳长度或 FAQ schema 的固定收益。
  • 不能把该专利视为所有答案界面的统一实现。

19. US9959315B1 — Context scoring adjustments for answer passages

  • Google Patents: US9959315B1
  • 优先权/申请日: 2014-01-31
  • 授权/公开日: 2018-05-01
  • Google Patents 当前状态: Active
  • 发明人: Nitin Gupta、Srinivasan Venkatachary、Lingkun Chu、Steven D. Baker
  • 受让人: Google LLC

专利披露的机制

  • 为候选答案段落建立从页面根标题到所属标题的 heading vector。
  • 根据标题层级路径、标题和查询的相似性、标题深度等计算 context adjustment。
  • 计算候选答案对所在文本区块的 coverage ratio。
  • 说明书还披露前置问题、问题到答案的文本距离、视觉突出文字、列表、HTML tags、microformats、列表位置和列表中的链接比例等候选特征。

可支持结论

  • Google 获得过利用标题层级、局部上下文和列表结构调节候选答案段落分数的专利。
  • 作为工程推论,清晰标题层级、问题与答案局部相邻、单段自足回答和真实列表结构更便于机器抽取和评价答案。

不可外推边界

  • 不能证明 H2、H3 或标题深度具有通用网页排名固定权重。
  • 不能证明加粗、列表或特定段落字数保证 Featured Snippet。
  • 不能证明该专利就是 Google 后来公开的通用 passage ranking 的生产实现。

20. US11093813B2 — Answer to question neural networks

  • Google Patents: US11093813B2
  • 优先权日: 2016-10-20
  • 申请日: 2017-10-18
  • 授权/公开日: 2021-08-17
  • Google Patents 当前状态: Active
  • 发明人: Ni Lao、Lukasz Mieczyslaw Kaiser、Nitin Gupta、Afroz Mohiuddin、Preyas Popat
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1输入文本段落和问题。
  • 用 encoder neural network 为段落 token 生成表示,并以 decoder/attention 类机制处理问题 token。
  • 生成 question-passage matching 表示,用于判断段落回答问题的程度。
  • 说明书允许把选出的答案段落与搜索结果一起呈现。

可支持结论

  • Google 获得过用神经网络评估问题与答案段落匹配程度的专利。
  • 在该技术中,文档级相关性和段落级回答性是可分开的任务。

不可外推边界

  • 不能把该专利直接称为已确认的 BERT passage ranking。
  • 不能证明 Google Search 当前使用该具体网络、参数或训练数据。
  • 不能推导出可供站长直接优化的单一 neural matching 分数。

21. US11003865B1 — Retrieval-augmented language model pre-training and fine-tuning

  • Google Patents: US11003865B1
  • 优先权/申请日: 2020-05-20
  • 授权/公开日: 2021-05-11
  • Google Patents 当前状态: Active
  • 发明人: Kenton Chiu Tsun Lee、Kelvin Gu、Zora Tung、Panupong Pasupat、Ming-Wei Chang
  • 受让人: Google LLC

专利披露的机制

  • 权利要求 1联合训练查询/任务输入向量、文档向量、retriever relevance distribution 和 language-model distribution。
  • 权利要求 4–5涉及文档向量搜索索引及 maximum inner product search。
  • 权利要求 6接收开放域问答任务,生成查询向量,计算知识语料中文档的 query relevance score,并据此检索文档。
  • 权利要求 7–9允许 Deep Bidirectional BERT-style transformer;权利要求 10允许知识语料包含远程网站。

可支持结论

  • Google 获得过检索器与语言模型联合训练、并在开放域问答中先检索文档再生成答案的专利。
  • 在该技术结构中,“被检索为候选”和“被语言模型使用”是两个不同阶段。

不可外推边界

  • 该专利主要涉及训练和开放域问答,不证明当前 Google Search 或 AI Overview 使用该具体实现。
  • 不能从专利反推出当前 embedding、模型、索引或 source-ranking 权重。
  • 不能证明第三方向量相似度工具可预测 Google 的生成式引用。

22. US11769017B1 — Generative summaries for search results

  • Google Patents: US11769017B1
  • 优先权日: 2022-12-30
  • 申请日: 2023-03-20
  • 授权/公开日: 2023-09-26
  • Google Patents 当前状态: Active
  • 发明人: Matthew K. Gray、John Blitzer、Corinn Herrick、Srinivasan Venkatachary、Jayant Madhavan、Sam Oates、Phiroze Parakh、Aditya Shah、Mahsan Rofouei、Ibrahim Badr
  • 受让人: Google LLC
  • 同家族记录: US11886828B1US11900068B1US12118325B2US20240220735A1WO2024145537A1US20250005303A1。这些按一个专利家族处理,不重复计为独立产品证据。

专利披露的机制

  • 权利要求 1接收查询和响应查询的文档内容,把查询与文档内容提供给 LLM,生成自然语言摘要,并显示对应文档的可选择链接。
  • 权利要求 11–12允许同时选择响应原查询的文档和响应 correlated related query 的文档。
  • 权利要求 13–15涉及从候选文档选择子集、计算 confidence measure,以及使用 query-dependent、query-independent 和 user-dependent 文档特征。
  • 权利要求 16–17涉及 related-query 相关程度阈值。
  • 权利要求 18–20涉及识别摘要中可验证的部分,并为该部分提供对应文档链接。
  • 权利要求 21–22涉及 implied query。
  • 说明书把相关查询、近期查询、隐含查询、降低陈旧信息和降低 hallucination 作为可能实施内容。
  • 同家族 US20250005303A1 还披露从多个生成模型中选择子集,或由分类器决定不选择生成模型;该记录为申请公开,应与已授权核心权利要求区分。

可支持结论

  • Google 获得过一组直接覆盖“搜索文档候选—相关/隐含查询扩展—LLM 摘要—置信度—可验证摘要部分—来源链接”的生成式搜索专利。
  • 传统搜索检索到的响应文档可以是生成式摘要的上游候选。
  • 在该披露中,候选文档选择可以同时参考查询相关、查询无关和用户相关特征。
  • 来源链接可以与摘要中的具体可验证部分对应,而不是只在页面末尾提供一个泛化参考列表。

不可外推边界

  • 不能把该专利家族等同于当前 AI Overview 的全部生产实现。
  • 不能确定当前模型、prompt、fan-out 查询数量、候选集大小、置信度阈值、来源排序权重或不同市场的覆盖范围。
  • 不能证明自然搜索排名前几就必然被引用。
  • 不能证明添加结构化数据、FAQ、作者简介、参考文献或某种段落格式即可保证生成式引用。
  • 不能把同家族多个 continuation 当作多次独立确认。

跨专利技术框架

仅从上述专利原文,可以把披露机制组织为以下层次:

  1. 抓取、索引与规范化:短语索引、重复文档聚类、代表 URL 选择、垃圾检测。
  2. 查询理解与候选召回:查询词和短语、锚文本、相关短语、实体和实体类型、相关查询及隐含查询。
  3. 基础排序:链接图重要性、链接权重、种子距离、历史数据、本地 prominence、实体指标和站点级分数。
  4. 质量与行为修正:低质量入链分布、人工标签训练质量模型、访问时长、查询—文档选择、展示偏差和异常过滤。
  5. 答案段落层:从已排序资源生成候选段落,结合局部结构和神经问题—段落匹配评分。
  6. 生成式摘要层:从搜索或检索候选中选择文档,生成摘要,评估置信度和可验证性,并连接支持文档。

这是一种对多个专利家族的分析性分层,不是 Google 发布的统一生产架构图。

最稳健的总括结论

  • 这些专利没有把 GEO 定义成一套独立于 SEO 的官方体系。
  • 专利披露更支持这样的技术关系:传统抓取、索引、查询理解、质量评价、链接/实体排序构成上游;答案段落和生成式摘要位于这些候选和信号之上。
  • 专利可以支持“机器可抓取、可规范化、可定位、可验证的内容更容易参与后续处理”这一工程推论,但不能把它写成 Google 的排名或引用保证。
  • 当前生产实现必须由 Google 官方产品文档、Google 员工明确公开发言、法院材料或 DOJ 证词另行确认;专利只承担技术披露证据。