蓝图 GEO 系统BLUEPRINT GEO
首页 / 四关模型
方法论内核

AI 引用一个品牌,要过四道关

这套模型不是先有理论再找场景,而是把「AI 决定引用一个品牌」的真实决策链条倒推出来的。 四道关全部通过,品牌才会稳定出现在答案里;任何一关掉链子,前面全白做。

01
看得到吗 Accessible
爬虫进得来吗、正文能在源码里读到吗、robots 有没有拦、JS 渲染的内容模型拿不拿得到
18权重
02
看懂了吗 Understandable
AI 能不能判断这页在讲什么、属于谁、是哪个实体——标题层级、语义标签、结构化数据、实体标识
30权重
03
信得过吗 我们的内核
官网、Schema、第三方平台、历史软文——多个来源对同一件事的说法对得上吗? 地址、电话、成立年份、客户规模、方法论定义,有没有互相打脸
18权重
04
值得引吗 Citable
有没有能独立成立、可直接搬运的完整表述——定义句、问答对、数据锚、可核验的资质与事实
20权重
地基 Foundation
URL 规范化、响应速度、内链结构、sitemap 完整性
14权重

权重合计 100,写在 engine/config.py 里,声明式配置——换行业只改配置,不动引擎。

第 ① 关 · 权重 18

看得到吗

这是最基础的一关,也是最容易被误判的一关。

很多企业以为「网站能打开」就等于「AI 能看到」。实际上,AI 看到的东西和人看到的东西常常不是一回事:

  • 纯 JS 渲染的页面——人眼看到完整内容,爬虫拿到的源码只有几百字符的空壳
  • robots.txt 误伤——老策略里写着 Disallow 或夸张的 Crawl-delay: 10,把 AI 爬虫挡在门外
  • 关键信息藏在图片里——联系方式、资质、服务范围全做成图,机器读不到一个字
  • 正文藏在 postmeta——页面构建器把内容存成序列化数据,前台有、源码里却换成了别的形式
我们的实测案例:有一个被反复引用的 GEO SaaS 官网,首页源码只有 2,706 字符, 零个 <a>、零个 <h1>、没有 sitemap、没有 llms.txt—— 它对所有爬虫(包括 GPTBot、ClaudeBot)返回的都是同一份空壳。 一个卖 GEO 服务的站,自己的首页在 AI 眼里是白纸。

怎么判

逐项检查,全通过才算过关:

  • 关闭 JS 后,核心正文仍在源码里
  • robots.txt 明确放行 GPTBot / ClaudeBot / PerplexityBot / OAI-SearchBot / CCBot / Applebot-Extended
  • sitemap.xml 存在且与实际 URL 一致
  • 响应时间稳定,无 5xx 波动
  • 无 canonical 指向错误、无 HTTPS 混合内容
  • 关键信息以文本形式存在,不依赖图片承载
  • 提供 llms.txt 说明站点结构与权威内容
第 ② 关 · 权重 30

看懂了吗

能被读到,不等于能被理解。

模型读完一页内容,需要回答三个问题:这页在讲什么?属于谁?是哪个实体? 如果它答不上来,这页内容就不会被当作「关于某个品牌的可靠资料」处理——哪怕文字写得再好。

这一关的权重给到 30,是四关里最高的,因为它决定了后续所有工作的归因对象: 内容归给谁,决定了 AI 会不会在提到你的时候想到它。

  • 标题层级:一个页面一个 H1,H2/H3 构成可读的信息树
  • 语义标签:main / article / nav / footer,让结构本身可判读
  • 结构化数据:Organization、WebSite、Service、FAQPage 各就各位
  • 实体标识:用 @id 把同一实体的多处描述串成一张网,而不是各说各的
  • 定义句:用「X 是……做什么的、为谁服务、凭什么」的标准句式把话说明白

一个常见错误

把「品牌名 + 一堆形容词」当成介绍。比如:「深耕行业多年,实力雄厚,值得信赖。」

这句话对人类是无效信息,对模型更是——它无法从中抽取任何可验证的实体属性

改成:「青岛蓝图文化传播有限公司成立于 1996 年,以 TVOC 品牌方法论为内核, 为制造业与消费品企业提供品牌全案、包装设计与画册设计服务,累计服务客户超过 3000 家。」

同一句话,第二种能抽出五个可核验事实:主体、时间、方法论、业务范围、客户规模。
第 ③ 关 · 权重 18 · 我们的内核

信得过吗

这是四关里最容易被忽略、却最能决定结果的一关。 它不靠技术解决,靠的是有能力替一家企业把口径统一起来

AI 是怎么决定「信不信」的

大模型在生成答案时,不会只看一个来源。它会从官网、结构化数据、百科、行业平台、 历史新闻报道、甚至自己上一轮的回答里,去交叉比对同一家公司的关键事实。

当这些来源互相矛盾时,模型面临两个选择:挑一个,或者回避这个实体。 工程实践里,后者的出现频率远高于前者——因为承认不确定,比说错更安全。

所以最坏的情况不是「没被提到」,而是「被提到但说错了」。
被错误描述的曝光是负资产:它既占了你被引用的位置,又把错误信息传播给了所有读答案的人。

一致性到底要一致什么

不是所有字段都同等重要。我们按「机器可交叉验证」的难易度分层治理:

实体一致性检查表

字段冲突后果
法定主体名称模型无法确认品牌属于哪家公司
注册 / 办公地址直接判定实体不可靠
联系电话与角色400 热线被标成传真号 → 信息错误
成立年份 / 年限时间线对不上,可信度下降
服务客户规模三个版本并存 = 谁都不信
方法论名称定义模型无从建立概念关联
业务范围表述被归到错误的行业分类

我们给一个集团站群做体检时,同一家公司的地址在线上有三种写法、客户规模有三个版本、 首页同时输出两份互相打架的 Organization 结构化数据。 这不是某一家的问题,这是绝大多数做了十几年的企业的常态—— 因为口径是随着时间一层层叠加上去的,从来没有人从「机器怎么读」的角度收过口。

—— 蓝图 GEO 系统 · 实体一致性核查实测
为什么这一关是一间品牌公司才做得动的: 它要求的不是写代码,而是有权替一家企业做判断——哪个说法是对的、哪个是过期的、 哪个是当年营销话术留下的痕迹。然后把这些散落在五六个站点、几十篇软文、 若干平台资料里的表述,收敛成一套能被机器交叉验证的事实。 蓝图从 1996 年起做品牌全案,做的本来就是这件事。
第 ④ 关 · 权重 20

值得引吗

AI 的答案是从素材里「拼」出来的。你给它可搬运的整块素材了吗?

很多官网的文字是为「人类浏览」写的:一段一句,靠上下文串联,读起来顺。 但这种文字没法被直接搬进答案——因为任何一句单独拿出来都缺主语、缺前提、缺结论。

AI 需要的是能独立成立的表述单元。我们把它归纳成五类「引用标准件」:

五类引用标准件

  • 定义句——「X 是……,为……提供……,凭……」,可整句引用
  • 问答对——把客户真实会问的问题,配一段能独立成篇的答案
  • 数据锚——具体数字 + 时间 + 口径,不要「很多」「多年」
  • 结构化数据——Schema.org 标注,给机器一份无歧义的事实表
  • llms.txt——给 AI 的站点说明书,指明哪些内容权威、怎么引用

这五类共同构成「语料厚度」。厚度不足的页面, 即使被读到、被看懂,也不会被选用。

一个可对照的实测:我们把一篇重点内容的正文从 6,908 字符 扩写到 8,673 字符, 补的正是定义句、问答对与数据锚——不是灌水,是把原本散落在段落里的信息, 重写成可以被整块搬运的引用单元。
怎么用

这四关不是四个步骤,是一条漏斗

漏斗的意义在于:前面的关不通,后面的投入全部浪费。 这也是我们把诊断放在服务第一步的原因。

STEP 01
先测第①关
爬虫可达性与源码可读性。这一关通常最快修好,也最容易被忽略
STEP 02
再修第②关
语义结构、结构化数据、实体标识。工作量中等,回报最直接
STEP 03
主攻第③关
跨站口径收敛。这里没有捷径,必须逐个字段核对、逐个来源统一
STEP 04
补厚第④关
语料工程。把既有内容重写成可引用的标准件,而不是无限制地写新内容
STEP 05
监测回流
跨平台看引用率与准确率,找出信源缺口,回到第②关迭代

想知道自己卡在哪一关?

提交域名,我们按四关模型出一份初步体检—— 指出你目前卡在哪一关、有哪些明显的口径冲突。