扫二维码与项目经理沟
我们在微信上24小时期待你的声音
解答本文疑问/谷歌外链咨询/GEO咨询/外贸建站咨询
别再拿SEO那套做GEO了,真的没用
先说我看到的一个现象。过去半年我接触了十几个做出海独立站的团队,大家碰到的困境惊人的一致:关键词排名没掉,但自然流量掉了30%到40%。有个做SaaS的朋友更惨,半年掉了快一半,他一开始以为是Google算法更新,后来我去帮他拉了一下用户搜索路径,才发现问题根本不在这儿。

他的目标用户已经不怎么在Google里搜关键词然后点链接了。那些人直接在ChatGPT里问“有没有一款工具能解决跨境物流追踪问题”,让AI给几个选项,然后追问“哪个对接最快”“哪个性价比高”,最后要么点进AI给的那个链接,要么连点都不点,直接在聊天框里就做了决策。
这不是个例。Ahrefs在2025年6月的一份报告里统计了7670万条Google AI Overviews、95.7万条ChatGPT prompts和95.35万条Perplexity prompts的数据,发现一个很扎眼的事实:AI Overviews、ChatGPT和Perplexity各自Top 50的引用来源里,重叠的只有7个网站。
也就是说,同一个话题,你在Google SGE里能被引用,不代表ChatGPT会理你;你在Perplexity里被当回事儿了,Google那边可能压根没抓到你。 每个平台的引文逻辑差异巨大,你拿一套内容想去讨好所有AI,最后大概率哪个都不讨好。
搞GEO你得先搞清楚你面对的是谁。
Google AI Overviews偏保守,它引用的来源跟传统搜索结果的重合度很高,医疗、金融、百科类内容有优势,但对电商、媒体类内容不太友好。ChatGPT更吃出版社和媒体的内容,它有大量授权合作,新闻、娱乐、体育类内容被引用的概率高,但医疗健康类内容很少。Perplexity的语料更国际化,很多本地化的小品牌在别的平台排不上号,但在Perplexity里能被引用。
还有一个有意思的数据。Semrush跟Kevin Indig在2025年6月做了一组测试,发现ChatGPT低推理模式和高推理模式下的引用来源重叠率只有25.6%。高推理模式下,引用率从50%飙到68%,平均引用来源从2.6个翻到4.5个,而且政府网站、学术机构的引用大幅增加,Reddit这种UGC内容的引用几乎腰斩。
这意味着什么?同一个ChatGPT,用户问同一个问题,开没开深度推理,引用的来源可能完全不一样。 你辛辛苦苦优化的内容,可能在一种模式下被引用了,在另一种模式下就消失了。这事儿没有标准答案,但你至少得知道它的存在,不能两眼一抹黑地去搞内容。
很多人做GEO还带着SEO的惯性思维:堆原创、搞干货、铺内容量。但我见过太多团队,内容做得很好,日更不断,结果AI要么不引用,要么引用完了转述出一堆错误信息。
根本原因很简单:传统SEO服务的是“字符串匹配”,靠关键词和外链;GEO服务的是“语义理解”,靠的是大模型能不能读懂、采信、引用你的内容。
核心区别在哪儿?搜索引擎的核心工作是排序,它给你排第一页就行了,点不点是你的事。但生成式引擎的核心工作是“知识生成”——它要批量抓取全网内容,自己解析、核验、筛选信源,然后重新整合出一段答案直接给用户。
这个机制决定了GEO的目标不是“排到第一页”,而是“成为AI答案的信源归属”。你的页面不需要排第一,只要被大模型判定为高可信信源,就能直接垄断对应问题的AI展示流量。
但问题来了——大模型有三大天生缺陷:语义歧义(同一个词在不同上下文意思不一样)、同质化内容稀释(全网内容都差不多,它没法区分谁更好)、溯源链路缺失(不知道谁写的、什么时候写的、靠不靠谱)。
怎么解决这三个问题?靠内容本身?内容再原创,在大模型眼里也就是一堆无序字符串。它不认“原创”,它只认“结构化可信度”。
我在落地层面看到的最大误区是:很多人部署了Schema,但用的是给SEO用的那套——为了出富摘要、展示评分和缩略图,字段可以简化、可以缺失、甚至带点营销色彩都行。搜索引擎只做语法校验,不核验内容的真实性。
但GEO用的Schema完全不是一套逻辑。GEO侧的Schema是做“知识确权”的,它要给页面内容做实体锚定、溯源确权和降噪加权。字段的精准度、内容的一致性、信息的唯一性都有强制校验,错一个字段、掺一句虚话,直接降权过滤。
哪些Schema类型对大模型真正有效?结合文心、通义、DeepSeek等主流模型的规则来看,优先级是这样的:
一级核心(决定能不能进候选池) :Article做文章知识确权,Organization做站点主体确权,FAQPage做问答场景精准采信。这三个是必装的,没有就进不去AI的信源池。
二级核心(场景刚需,决定优先级) :Product做产品结构化,Service做服务能力结构化。如果你是做电商或者B2B服务的,这两个是加分项。
无效字段坚决剔除:各种展示型扩展字段、空值占位字段、装饰性冗余标签,全部会触发模型的降噪机制,加了不如不加。
还有个关键点:单页面只能绑定一个核心实体,Article+FAQ、Product+Service这种多标签叠加是大忌,模型会搞不清你这个页面到底是什么,直接判定为噪声。
GEO最头疼的问题是度量。传统SEO有排名、有流量,效果可量化。但GEO怎么衡量?总不能老板问“花这笔钱带来多少线索”,你回答“品牌在AI生态的长期占位”吧。
目前业界共识是几个维度组合着看。
一个是工具监测:品牌在特定Prompt下被AI提及的频次、被引用为信源的次数、被引用时的排序(是首推还是备选)、AI描述的信息是否准确正面。这些指标没法直接对应后端转化,但至少能证明你的优化动作确实干预了AI的输出。
一个是预埋“暗号” 。在GEO内容里埋一些特殊的搜索词或独家概念(只在这次发布的GEO文章里用),然后监测这些词在全网自然搜索量的起伏。如果用户看了AI的回答之后,又去传统搜索引擎搜这些词来验证,那就能侧面证明GEO的曝光确实驱动了后续的主动搜索行为。
一个是链接追踪。在允许带外链的内容里加上UTM参数,在网站分析工具里看来自AI平台的Referrer和访问深度。目前AI搜索的链接点击率整体还不高,但胜在精准,进来的用户转化意愿很强。
还有一个是A/B测试。一段时间内保持其他营销动作不变,只集中做GEO,然后对比这段时间的后端转化增长。特别是B2B业务,如果GEO策略执行后,客户从初次接触到最终成单的平均销售周期明显缩短了,这本身就是GEO价值的间接证明。
最后说一个我觉得很有参考价值的研究。2026年4月arXiv上发了一篇论文,作者用了一个叫geo-citation-lab的公开数据集,分析了602个Prompt、21143条有效引用记录和18151个成功抓取的页面。
有几个反直觉的发现:
引用数量和引用深度是两个完全不同的东西。 Perplexity平均每个Prompt引用16.35个来源,Google是12.06个,ChatGPT只有6.88个。但被引用页面的“影响力得分”刚好反过来——ChatGPT引用的页面影响力最高,达到0.2713,而Google只有0.0584,Perplexity是0.0646。少引用不代表没影响,多引用不代表真的用了你的内容。
Q&A格式本身对提升被引用深度几乎没有帮助。 研究发现带Q&A格式的页面平均影响力是0.0947,不带的是0.1005,反而低了5.74%。真正让大模型深度吸收你内容的是:页面的语义对齐度、证据密度(定义、数据、对比、步骤这些“证据类型”的含量)以及结构的模块化程度。别把精力花在套问答格式上,花在内容本身的证据密度上。
英文不是万能的。 在ChatGPT上,中文Prompt的平均引用数反而比英文更高(7.77 vs 7.03),Google那边正好相反(11.57 vs 7.53)。语言偏好跟平台高度相关,别无脑追英文内容,看你目标用户用哪个平台。
做海外GEO这事,最怕的是拿国内那套“大力出奇迹”的思路去套。海外的内容过滤机制比国内严得多,Wikipedia的利益冲突机制、Reddit的反机器人规则、Google最近在Search Central Live上强调的“信息增量分数”排名因子,都是冲着过滤AI水货内容去的。
你花一个月批量搞出来的内容,AI模型可能三天就把你拉黑了。与其这样,不如先把官网的Organization和Article Schema部署好,把FAQ页面的结构化数据做扎实,然后在Reddit和行业论坛里老老实实做社区,别想着走捷径。
GEO不是AI版的SEO,它是从“让搜索引擎理解你”到“让AI模型信任你”的一次底层切换。 理解不了这个区别,做什么动作都是白搭。

我们在微信上24小时期待你的声音
解答本文疑问/谷歌外链咨询/GEO咨询/外贸建站咨询