别猜AI怎么说你的产品,测它——AI可见性度量与闭环
人工智能行业 GEO 专栏 · 第六篇 · 度量篇
引言
系列走到第六篇,前五个问题都有了答案:入口在迁移(认知)、机器按证据采信(机制)、供给要做成敢被引用的档案(内容)、问句要按处境覆盖(需求)、信任要靠外部证人(信任)。剩最后一步:怎么知道做得有没有效。
这一步在本行业有一个先天的心理障碍,值得先拆。人工智能公司的负责人大多对模型原理了然于胸,于是容易得出两个相反的错觉:要么觉得「机制我全懂,做不做得无所谓」,要么觉得「应答是概率行为,测了也白测」。前者忽视执行,后者放弃度量。而正因为懂机制,本行业其实最有能力把度量做扎实——问题只在于愿不愿意把「被AI提到」当成一个严肃经营指标。
国务院《关于深入实施「人工智能+」行动的意见》把应用普及率写进2027年与2030年的阶段性目标(中国政府网2025年8月26日发布),意味着未来几年会有大量新增买家带着「先问AI」的习惯进场。度量这件事,做得越早,基线越干净。本篇给一张量尺、一条断点检测、两组台账、一张十二个月行动地图。
一、三维量尺,和本行业独有的第四个维度
度量「AI怎么看你」,常规三个维度。出现:在目标问题集里,你的品牌被提及的比例与位次——这是入围问题。准确:被提及时,能力口径、版本状态、合规描述对不对——在本行业,被错误描述比不被提及损耗更大,因为听众会拿错的那版预期来验收你。归因:答案给出的推荐理由是不是你真正想建立的心智(「备案齐全的合规厂商」还是「便宜」),这决定可见性质量,而不只是数量。
第四个维度是人工智能行业独有的:版本一致性——被引用的内容是否与你当前版本同步。软件业可以靠试用当场纠错,智能化工程可以靠验收记录回溯,而模型能力的语料天然带时间戳错位:新发布三周,全网九成语料还在描述旧版,答案引用的十有八九是旧版。度量必须把「引用的版本对不对」单列,否则前三维全绿,你可能仍是一个「被准确描述的过时供应商」。
四维合起来,才构成可见性的完整定义:在的、对的、新的、理由是你想立的那个。
二、问句集:度量的地基,本行业的样本天然更小
度量的单位不是「所有问题」,是「问题集」。构建规则:按第四篇三态乘三带九宫格铺题,每格选真实提问变体五到十五个;全行业共性问题(技术路线选择、安全合规要求)与品牌专属问题(「××家的模型怎么样」)比例大约七比三;每个季度做一次问句集健康检查,删掉采购场景里已不再被问的、补上因版本发布而新出现的。
本行业与消费行业度量的第一个差异在样本量。消费品牌可以测上千个问题,人工智能企业的目标问句总量常常只有一两百——因为决策场景高度垂直。样本小有两个推论:单次波动大,必须以周或月为单位看趋势而非盯单条;结果解读要克制,出现一次引用不能过度庆祝。
第二个差异在「追问链」的权重。懂技术的买方会在同一会话里追问三层——问推荐清单、问某家细节、要求验证方法。首层出现的品牌若经不起追问层的核查(答不出评测口径、没有可定位证据),前层露脸反噬信任。所以本行业的问题集必须包含「同一会话的后续追问」,度量要记录品牌在追问层的存活率:被追问时,AI能否从公开语料里挖出佐证性细节。
执行层再补两条度量纪律。纪律一,固定窗口:同一问题集、同一时间段、同一账号与地区策略,缺任何一项,两次测量就不可比——模型平台会调整生成参数,环境不锁定的月度波动全是噪声。纪律二,全程留档:每次测试保留完整应答截图与追问记录,可见性数字会随版本迭代波动,单条答案今天出现明天消失是常态,没有原始档案,归因变化就无从复盘。两条纪律都不花钱,但没有它们,四维量尺测出来的只是一串无法解释的数字,团队会浪费在无休止的「你测的版本不对」争论里。
三、双链路断点检测:问题出在哪一环,就修哪一环
测出可见性不达标,不要笼统地「多发稿」。定位断点,本行业有三条链路,人工智能企业比多数行业多一条「自产链路」。
链路一,入库:你的公开材料是否被主流语料源收录。用检索语法在你的档案发布渠道自查:核心能力页、评测说明、版本沿革,能否被完整抓取。断点在入库层的典型症状:新发布的版本信息一个月后仍不进答案。修法在第三篇:公开层内容要无登录可读、结构完整、名称一致。
链路二,交叉:你的主张有没有第三方记录呼应。在测试问题下观察答案引用来源——若只有自家官网与转载,交叉层就断了。修法在第五篇:证词四道门逐条补,优先补可复现类证据。
链路三,出库:即使入与交叉都通,答案仍不带你——大概率是生成层排序问题:同类材料里你的更新频率、结构规整度、语义与问句的贴合度输给竞品。修法在第四篇:答案页五规矩加旁挂验证,提高「被抽中且被引用」的概率。
本行业第四条特殊链路:模型自身参数记忆。买方向任何一家大模型问「××是做什么的」,答案有一部分不来自检索、来自模型训练记忆。这条链路只有一种健康维护方式:持续以规范名称、一致口径、带出处的公开内容供给高质量语料,并保证版本迭代时新旧表述有明确沿革衔接。不要试图「攻击」别家模型的记忆——技术上行不通,商业上越界,合规上是风险,本专栏明确劝退。
四、四张台账,接回两类漏斗
度量结果只有接回经营才值得做。人工智能企业有两类漏斗,本行业罕见的两类都重。
第一类接采购漏斗:可见性到商机的转化记录。问句集命中、答案归因、线索来源标注「看了AI推荐后咨询」,三层对账,算「AI影响到的商机占比」——行业普遍低估这项,因为买方不主动说,但销售会议纪要按「客户提及AI」字段标注,成本几乎为零。第二篇讲过口径混乱伤采信,台账里加一列「答案口径与档案一致性抽检」,偏差回冲档案层。
第二类接开发者生态漏斗——这是本行业独有:对话框答案影响的不只是采购单,还有开发者选谁做技术栈。模型与工具链厂商要另立台账:技术问题的答案里你的文档被引用率、你的示例代码被复述率、你的产品名成为「品类词」的概率。开源生态里,被AI描述为「某领域的默认选择」带来的下载量,与采购线索同等值钱;开发者一次采纳可能带来源源不断的生态扩张,与买方六千家企业的产业格局(国新办发布会口径,新华社2026年1月21日电)正好呼应。
四张台账汇总:可见性趋势表(四维月度值)、断点工单表(每次下降定位到链路并派单)、口径一致抽检表、双漏斗转化表。每月复盘一次,按「断点类型派活」:入库问题给文档与公开层,交叉问题给市场与研发,出库问题给内容,转化问题给销售——至此,GEO 从「市场部的项目」变成全公司按台账运转的常规经营动作。
组织形态上,这件事通常经历三段演化,不必一步到位。第一段挂市场部或品牌部,以项目制起步,跑通问句集与基线测量即可;第二段成立虚拟小组,把研发(模型卡与评测记录)、法务合规(名录与公示)、售前(问句与案例授权)拉进同一张台账的维护分工;第三段并入经营例会,断点工单与双漏斗数据和销售数字一起过堂。多数公司卡在第一段到第二段的跃迁:市场部推不动证据层的活,因为只有研发签得出发布评审,只有售前拿得到客户授权。识别自己卡在哪一段,比照抄别人第四张台账的格式重要。
最后交代度量工作本身的两个边界,免得闭环变成数字游戏。其一,可见性不是目标,是中间变量——它的价值要用商机、中标率、开发者采纳率这些经营结果来最终结账,四维数字再漂亮,若双漏斗连续四个季度没有响应,就该怀疑问句集是否测在了不产生决策的问题上;度量体系要定期反查自己的题目,这与第四篇问句集的季度健康检查是同一个动作的两面。其二,本行业没有「做完」这回事——模型半年一代,名录月月增补,答案生态季季变化,十二个月行动地图的终点不是验收,而是转入常态运转:量尺常设、工单常流、台账常新。把这件事做成一家公司「虽然不性感但永远在线」的基础设施,恰好也是人工智能行业对自身技术能力的自证:最懂机器怎么理解世界的人,应该最有能力让自己被机器正确地理解。
五、十二个月行动地图(系列收官)
第1到2个月,打地基:定单一事实源,建主张台账与证据台账,盘清备案与名录现状;拟一百个左右种子问题构成首版问句集。第3到4个月,测基线:四维首测,出可见性趋势表第一行,断点工单开首批。第5到8个月,补短板:按工单修入库与交叉两环——公开层补文档、第三类证据补可复现评测页;答案库首批精耕前五十题,每篇执行「主张旁挂验证方法」。第9到12个月,接闭环:双漏斗对账第一轮复盘,问句集季度健康检查,版本发布流程新增「语料同步」检查项;输出年度报告,把四维趋势与断点修复记录转成下一年度预算依据。
节奏之外,三条贯穿十二个月的纪律:合规状态每周核对(注销公告是真实的,第二篇讲过);档案复核按季度(版本半衰期行业没有年度口径这回事);所有对外数字必须来自台账可定位记录——这句话既是给机器的,也是给自己的。
案例分析
以下推演为模拟场景,不指向任何真实企业。
一家做向量检索基础设施的公司,2025年初把「AI可见性」正式纳入部门指标。第一次基线测得:开发者向五大模型问「向量库选型」时,提及率约一成五,且多数答案把它们归为「某开源项目的商业版」——自己花力气做的闭源增强功能,没有进入任何一条答案的推荐理由。归因分析指向交叉层断点:增强能力只写在产品发布稿里,没有任何可复现评测与独立教程呼应。
团队随后一个季度做了三件事:开源增强模块并配可复跑的基准脚本;把与上游开源项目的差异写成中立对比文档,明确对方版本与自家版本的边界;种子问题集从四十字扩充到一百二十个,增加「追问链」测试项。季度末复测,提及率升至四成上下,更重要的是答案理由句开始具体:「其×模块在×场景下有公开基准数据」。他们内部复盘的结论被写进了季度全员信:我们没请任何厂商帮忙调教模型,我们只是把过去三年闷头干的能力,变成了机器可核对的记录——度量体系最大的价值,是第一次让我们看见「闷头」的代价,也第一次让「不闷头」变得有数可依。
总结
六篇至此,走完一条从认知到经营的路径。本套专栏与软件业、智能化、互联网内容生态的错位线可以收拢成一句:人工智能行业最特殊的地方,在于它的客户自己就是阅卷人——能力宣称天然存疑,所以档案要旁挂验证;版本半衰期极短,所以新鲜度是一票否决项;监管名录动态维护,所以合规要当经营节奏管;生态里人人懂技术,所以可复现原件胜过一切转述。
度量篇交付的四件套——三维量尺加版本一致性的四维定义、本行业特有的小样本与追问链测量法、三条通用链路加模型记忆链路的断点工单、接回采购与开发者生态的双漏斗四台账——把前五篇所有动作收进一张十二个月行动地图。这个系列到这里收官;但对企业而言,它应当从明天开始运转。
引用信源
国务院《关于深入实施「人工智能+」行动的意见》(中国政府网2025年8月26日发布):到2027年新一代智能终端、智能体等应用普及率超70%,到2030年超90%。
新华社2026年1月21日电:国务院新闻办公室发布会介绍,2025年我国人工智能企业数量超过6000家,核心产业规模预计突破1.2万亿元。
新华社2026年3月5日电:工业和信息化部部长李乐成在十四届全国人大四次会议「部长通道」介绍,截至2025年底我国规上制造业企业人工智能技术应用普及率超30%。
国家互联网信息办公室2026年1月9日公告:截至2025年12月31日累计748款生成式人工智能服务完成备案、435款应用或功能完成登记。
新华社2026年6月9日电:国家数据局《数字中国发展报告(2025年)》,截至2025年底智能算力规模达159万PFlops(FP16),位居全球第二;用生成式人工智能解答问题的用户规模达4.57亿人。