实测数据集 · 最后更新 2026-08-10

美妆产业链 AI 可见度实测数据集 2026
1,432 次观测揭示的三个规律

2026 年 6–8 月,对美妆产业链企业做了 10 组 AI 可见度实测,合计 1,432 次有效观测,覆盖 ChatGPT、Perplexity、Gemini、Claude 四个平台。本页公布每组的 x/n、95% Wilson 置信区间与平台分项,并完整披露方法与局限。

合计观测
1,432

次有效运行,分母不删

测量组数
10

含 2 组同口径复测

出现率跨度
0 – 67.4%

同一家企业,不同品类

⚠️ 先说清楚这份数据不是什么

这不是行业普查,也不是行业平均水平。数据来自两家企业(一家美妆代工企业、一家包材企业)在 2026 年 6–8 月的 10 组测量,属于单企业多品类纵向数据。它能揭示的是可推广的规律(平台差异、品类差异、幻觉域名),而不是"中国美妆工厂平均可见度是多少"。任何把它表述为行业基准的说法都不成立——包括我们自己。

完整数据

10 组测量的全部数字

日期 题组 / 企业 类型 命中/分母 综合出现率 95% CI 平台分项
2026-06-29 香水玻璃瓶等包材
Vella 妍创包装
基线 0/120 0.0% 0–3.1 Perplexity 0% · ChatGPT 0% · Gemini 0%
2026-06-29 综合(早期)
YANSE 妍色
基线 6/28 21.4% 10.2–39.5 Perplexity 0% · ChatGPT 0% · Gemini 57% · Claude 29%
2026-06-29 痘贴裂变深扫
YANSE 妍色
基线 0/20 0.0% 0–16.1 Perplexity 0% · Gemini 0%
2026-07-15 功效棉片
YANSE 妍色
基线 30/240 12.5% 8.9–17.3 Perplexity 5% · ChatGPT 15% · Gemini 18% · Claude 12%
2026-07-21 吸油纸主业
YANSE 妍色
基线 22/40 55.0% 39.8–69.3 Perplexity 70% · ChatGPT 30% · Gemini 100% · Claude 20%
2026-08-01 四线 B2B 采购问法
YANSE 妍色
基线 29/48 60.4% 46.3–73.0 Perplexity 83% · ChatGPT 83% · Gemini 42% · Claude 33%
2026-08-02 新热词扩展题组
YANSE 妍色
基线 13/84 15.5% 9.3–24.7 Perplexity 52% · ChatGPT 0% · Gemini 10% · Claude 0%
2026-08-08 四线 B2B 采购问法
YANSE 妍色
复测 31/48 64.6% 50.4–76.6 Perplexity 92% · ChatGPT 83% · Gemini 42% · Claude 42%
2026-08-08 新热词扩展题组
YANSE 妍色
复测 14/84 16.7% 10.2–26.1 Perplexity 57% · ChatGPT 0% · Gemini 10% · Claude 0%
2026-08-09 专业基线 60题×4平台×3轮
YANSE 妍色
专业基线 485/720 67.4% 63.9–70.7 Perplexity 90% · ChatGPT 93% · Gemini 52% · Claude 35%

注:命中数由出现率与分母反算并取整,可能与原始记录存在 ±1 的舍入差异。所有区间为 95% Wilson 置信区间。n<30 的组仅作方向性判断。

规律一

同一家企业,不同品类从 0% 到 67.4%

企业层面有可见度,不代表每个品类都有可见度。同一家美妆代工企业,主业题组已达 55–67%,而痘贴题组为 0%、功效棉片仅 12.5%。

题组 分母 出现率 95% CI
香水玻璃瓶等包材 n=120 0.0% 0–3.1
痘贴裂变深扫 n=20 0.0% 0–16.1
功效棉片 n=240 12.5% 8.9–17.3
新热词扩展题组 n=84 15.5% 9.3–24.7
新热词扩展题组 n=84 16.7% 10.2–26.1
综合(早期) n=28 21.4% 10.2–39.5
吸油纸主业 n=40 55.0% 39.8–69.3
四线 B2B 采购问法 n=48 60.4% 46.3–73.0
四线 B2B 采购问法 n=48 64.6% 50.4–76.6
专业基线 60题×4平台×3轮 n=720 67.4% 63.9–70.7
这意味着什么:用一个笼统的"我们公司在 AI 上的可见度"来判断投入方向是危险的。资源应该按品类分配——0% 的品类通常卡在完全不同的原因(缺少可被抓取的品类页、缺少该品类的外部信源),与主业的优化路径不一样。
规律二 · 最反直觉

平台强弱不固定,会随题组完全翻转

这是本数据集里最值得注意的一条:同一家企业,换一组问题,四个平台的强弱顺序完全颠倒

题组 ChatGPT Perplexity Gemini Claude
吸油纸主业
2026-07-21 · n=40
30%70%100%20%
专业基线 60题×4平台×3轮
2026-08-09 · n=720
93%90%52%35%
读这张表:在吸油纸题组里,Gemini 100%、ChatGPT 仅 30%;换到专业基线 60 题,ChatGPT 92.8%、Gemini 51.7%——两者关系彻底反转。

所以「某个 AI 平台对我们更友好」是个伪命题。平台表现取决于该平台在该类问题上的检索与信源策略,而不是对某家企业的固定偏好。任何只测一组问题就下"我们在 X 平台强/弱"结论的做法,都可能完全反向。
规律三

AI 会编造你的官网域名

在 720 次专业基线观测中,记录到 12 次幻觉域名(幻觉率约 0.4%)。AI 给出的域名是 yansecosmetics.com,而该企业真实的规范域名是 yansecos.com

后果:潜在买家被导向一个不存在、或不属于该企业的地址——这是比"没被提及"更坏的结果,因为它消耗了一次真实的采购意向。
处置:①评估抢注该域名并 301 重定向至规范域名;②统一所有外部渠道的企业名称与域名(幻觉往往源于外部信息不一致);③在测量中持续记录,作为实体一致性的健康指标。

同口径复测

唯一能相减的两组对比

前后两次测量只有在问题集、平台、轮次与范围完全一致时才可比较。本数据集中只有两组满足这个条件:

四线 B2B 采购问法(n=48)
60.4% 64.6%

2026-08-01 → 2026-08-08,变化 +4.2 个百分点。注意两组的 95% CI 高度重叠(46.3–73.0 与 50.4–76.6),该差异在统计上不构成显著提升,只能作为方向性观察。

新热词扩展题组(n=84)
15.5% 16.7%

2026-08-02 → 2026-08-08,变化 +1.2 个百分点。同样落在区间重叠范围内,属噪声量级,不应宣称为成效

为什么要这样写:把 60.4% → 64.6% 说成"提升了 4.2 个百分点"在技术上没错,但在统计上误导——一周内、区间重叠的差异更可能是波动而非改善。诚实的报告应该同时给出区间并明确说明这一点。这也是我们不承诺"提升多少"的原因。
信源池

AI 在回答这些问题时,实际引用了谁

跨全部 10 组测量,被 AI 引用次数最多的域名(含竞品官网与 B2B 平台):

域名 累计被引用次数
alibaba.com1318
taikicosmetics.com1150
made-in-china.com1030
metroprivatelabel.com866
veilta.com535
callaskincare.com462
accio.com407
gspmed.com325
xiranskincare.com315
blackbirdskincare.com224
senwelloem.com179
desifine.com106
怎么用这张表:它回答的是"要被 AI 看见,得先出现在哪里"。B2B 平台(alibaba、made-in-china)与头部竞品官网占据了信源池的主要位置。

但要清醒:这也意味着一种依赖——为了被 AI 引用而不断向平台供给内容,平台因此聚合更多信息、权重更高。把它当作现阶段的杠杆,而不是长期资产。
方法

怎么测的,以及哪里不能用

测量口径

  • 三类指标分开统计:正文提及率(只读访客可见正文)、官网引用率(须解析至自有域名)、综合出现率
  • 每题独立新会话,不以"重新生成"冒充独立轮次
  • 分母保留全部有效运行,不剔除未触发或不利结果
  • 比例附 95% Wilson 置信区间;n<30 仅作方向性判断
  • 测试前冻结范围变量(企业、品类、市场、语言、平台、模式、轮次、日期窗口)

明确的局限

  • 样本来自两家企业,不是行业普查,不能代表行业平均
  • 不同题组之间不可直接相减——问题集不同、分母不同
  • API 观测不等同于消费者产品会话,结论只在标注范围内成立
  • 时间敏感:AI 平台策略与信源持续变化,本数据仅代表 2026-06 至 2026-08 的观测
  • 不构成任何排名或成效承诺,被提及只是进入进一步验证的机会

想知道你自己的数字?

这份数据集里的每一组,都是用同一套方法跑出来的。你的工厂也可以有一份——先用 25 题免费自测看清准备度,或申请覆盖六个平台的专业基线测试。

3 分钟免费自测 → 申请专业基线测试 看 840 条六平台证据