AI 引用一个品牌,要过四道关
这套模型不是先有理论再找场景,而是把「AI 决定引用一个品牌」的真实决策链条倒推出来的。 四道关全部通过,品牌才会稳定出现在答案里;任何一关掉链子,前面全白做。
权重合计 100,写在 engine/config.py 里,声明式配置——换行业只改配置,不动引擎。
看得到吗
这是最基础的一关,也是最容易被误判的一关。
很多企业以为「网站能打开」就等于「AI 能看到」。实际上,AI 看到的东西和人看到的东西常常不是一回事:
- 纯 JS 渲染的页面——人眼看到完整内容,爬虫拿到的源码只有几百字符的空壳
- robots.txt 误伤——老策略里写着
Disallow或夸张的Crawl-delay: 10,把 AI 爬虫挡在门外 - 关键信息藏在图片里——联系方式、资质、服务范围全做成图,机器读不到一个字
- 正文藏在 postmeta——页面构建器把内容存成序列化数据,前台有、源码里却换成了别的形式
<a>、零个 <h1>、没有 sitemap、没有 llms.txt——
它对所有爬虫(包括 GPTBot、ClaudeBot)返回的都是同一份空壳。
一个卖 GEO 服务的站,自己的首页在 AI 眼里是白纸。
怎么判
逐项检查,全通过才算过关:
- 关闭 JS 后,核心正文仍在源码里
- robots.txt 明确放行 GPTBot / ClaudeBot / PerplexityBot / OAI-SearchBot / CCBot / Applebot-Extended
- sitemap.xml 存在且与实际 URL 一致
- 响应时间稳定,无 5xx 波动
- 无 canonical 指向错误、无 HTTPS 混合内容
- 关键信息以文本形式存在,不依赖图片承载
- 提供 llms.txt 说明站点结构与权威内容
看懂了吗
能被读到,不等于能被理解。
模型读完一页内容,需要回答三个问题:这页在讲什么?属于谁?是哪个实体? 如果它答不上来,这页内容就不会被当作「关于某个品牌的可靠资料」处理——哪怕文字写得再好。
这一关的权重给到 30,是四关里最高的,因为它决定了后续所有工作的归因对象: 内容归给谁,决定了 AI 会不会在提到你的时候想到它。
- 标题层级:一个页面一个 H1,H2/H3 构成可读的信息树
- 语义标签:main / article / nav / footer,让结构本身可判读
- 结构化数据:Organization、WebSite、Service、FAQPage 各就各位
- 实体标识:用
@id把同一实体的多处描述串成一张网,而不是各说各的 - 定义句:用「X 是……做什么的、为谁服务、凭什么」的标准句式把话说明白
一个常见错误
把「品牌名 + 一堆形容词」当成介绍。比如:「深耕行业多年,实力雄厚,值得信赖。」
这句话对人类是无效信息,对模型更是——它无法从中抽取任何可验证的实体属性。
改成:「青岛蓝图文化传播有限公司成立于 1996 年,以 TVOC 品牌方法论为内核, 为制造业与消费品企业提供品牌全案、包装设计与画册设计服务,累计服务客户超过 3000 家。」
信得过吗
这是四关里最容易被忽略、却最能决定结果的一关。 它不靠技术解决,靠的是有能力替一家企业把口径统一起来。
AI 是怎么决定「信不信」的
大模型在生成答案时,不会只看一个来源。它会从官网、结构化数据、百科、行业平台、 历史新闻报道、甚至自己上一轮的回答里,去交叉比对同一家公司的关键事实。
当这些来源互相矛盾时,模型面临两个选择:挑一个,或者回避这个实体。 工程实践里,后者的出现频率远高于前者——因为承认不确定,比说错更安全。
被错误描述的曝光是负资产:它既占了你被引用的位置,又把错误信息传播给了所有读答案的人。
一致性到底要一致什么
不是所有字段都同等重要。我们按「机器可交叉验证」的难易度分层治理:
实体一致性检查表
| 字段 | 冲突后果 |
|---|---|
| 法定主体名称 | 模型无法确认品牌属于哪家公司 |
| 注册 / 办公地址 | 直接判定实体不可靠 |
| 联系电话与角色 | 400 热线被标成传真号 → 信息错误 |
| 成立年份 / 年限 | 时间线对不上,可信度下降 |
| 服务客户规模 | 三个版本并存 = 谁都不信 |
| 方法论名称定义 | 模型无从建立概念关联 |
| 业务范围表述 | 被归到错误的行业分类 |
我们给一个集团站群做体检时,同一家公司的地址在线上有三种写法、客户规模有三个版本、 首页同时输出两份互相打架的 Organization 结构化数据。 这不是某一家的问题,这是绝大多数做了十几年的企业的常态—— 因为口径是随着时间一层层叠加上去的,从来没有人从「机器怎么读」的角度收过口。
—— 蓝图 GEO 系统 · 实体一致性核查实测值得引吗
AI 的答案是从素材里「拼」出来的。你给它可搬运的整块素材了吗?
很多官网的文字是为「人类浏览」写的:一段一句,靠上下文串联,读起来顺。 但这种文字没法被直接搬进答案——因为任何一句单独拿出来都缺主语、缺前提、缺结论。
AI 需要的是能独立成立的表述单元。我们把它归纳成五类「引用标准件」:
五类引用标准件
- 定义句——「X 是……,为……提供……,凭……」,可整句引用
- 问答对——把客户真实会问的问题,配一段能独立成篇的答案
- 数据锚——具体数字 + 时间 + 口径,不要「很多」「多年」
- 结构化数据——Schema.org 标注,给机器一份无歧义的事实表
- llms.txt——给 AI 的站点说明书,指明哪些内容权威、怎么引用
这五类共同构成「语料厚度」。厚度不足的页面, 即使被读到、被看懂,也不会被选用。
这四关不是四个步骤,是一条漏斗
漏斗的意义在于:前面的关不通,后面的投入全部浪费。 这也是我们把诊断放在服务第一步的原因。