这些品牌事实,AI 真的知道吗?

持续观察审定语料在主流 AI 回答中的体现、准确性与引用情况。

最近完整验证:2026-09-19 10:00 | 检测品牌:华为 | 问题集 v1.2(6 类固定问题)| 检测口径:新会话 · zh-CN · 每问 1 次 · 演示数据

6 个平台
已监测 AI 平台
本期实际运行
86%
品牌提及率
应提及问题中正确提及 43/50
91%
事实一致率
与审定事实一致 41/45
42%
引用可追溯率
待提升 · 含可访问来源
12
本期发现认知问题
9 个已进入优化
09-19
最近验证时间
下一批计划 2026-10-05
当前验证问题 · 历史沿革 / 问题版本 v1.2
"请介绍该品牌的发展历程与核心事实。"
豆包
4/5 事实匹配
1 条缺失
无平台引用
Kimi
3/5 事实匹配
1 缺失 · 1 冲突
无平台引用
DeepSeek
5/5 事实匹配
含 2 条引用
引用平台来源 2 条
文心
3/5 事实匹配
待人工复核
无平台引用
通义
4/5 事实匹配
无平台引用
无平台引用
ChatGPT
4/5 事实匹配
含 1 条引用
引用平台来源 1 条
检测口径
新会话 · zh-CN · 第 1 次
模型回答具随机性,结果需结合重复采样;不同问题版本 / 模型版本 / 会话条件不可直接合并成趋势。

Kimi 回答与审定事实对照

原始回答已保存 · 机器初判 · 待人工复核 · 事实判断总数 5 条
正确:品牌创立时间与事实库一致 F-001
正确:核心业务描述与事实库一致 F-004
正确:总部所在地与事实库一致 F-002
缺失:未体现 2018 年关键发展节点 F-018
冲突:门店覆盖城市数量与最新空间快照不一致 F-GEO-018
标准事实 5 条 | 正确体现 3 条 | 缺失 1 条 | 冲突 1 条 | 引用平台来源 0 条
评价口径:不把语气、风格或观点差异计入事实错误;只比对可核验的事实判断。

问题处理建议

不能简单归因于"模型未收录",先定位问题环节
缺失事实 → 语料补充任务
检查语料发布与可发现性:页面是否可检索、事实是否已发布、表达是否清晰。
空间事实冲突 → 证据核验与事实更新
门店覆盖城市数量与最新空间快照不一致,进入核验流程。
关联标准事实 F-018 · F-GEO-018
建议任务 语料补充 + 空间事实复核

指标定义

指标定义本期演示值
品牌提及率正确提及品牌的问题次数 ÷ 应提及品牌的问题总次数
只出现相似名称不算正确提及;集团、子品牌与产品名需建立实体映射
86%(43/50)
核心事实体现率回答中被正确表达的目标事实数 ÷ 本次问题应覆盖的目标事实数78%(35/45)
事实一致率与审定事实一致的事实判断数 ÷ 回答中可核验的事实判断总数91%(41/45)
引用可追溯率带可访问、可核验来源的回答次数 ÷ 返回有效回答的总次数
区分「引用平台」「引用权威外部来源」「无引用」
42%(21/50)
好感度(观察指标)拆成正向评价 / 中性事实 / 负面评价 / 争议性内容四类,保留原回答上下文;不代替准确性正向 34% · 中性 58% · 负面 8%
优化闭环率已完成处理的 AI 认知问题数 ÷ 本期发现的问题总数 | 平均处理时长75%(9/12)| 4.2 天

固定问题库

问题类型示例主要检测指标
身份认知这个品牌是谁?主要做什么?提及率、基础准确性
历史沿革这个品牌的发展历程是什么?核心事实体现率
产品与能力主要产品、服务或技术有哪些?完整性、准确性
社会贡献有哪些公益、就业或产业贡献?证据覆盖、引用情况
地域事实在哪些城市或地区开展业务?空间事实一致率
风险纠错关于该品牌常见的错误说法是什么?冲突识别、纠错效果

问题必须保存版本。问题改写、模型版本变化和采样参数变化都会影响结果,不能把不同口径数据直接组成趋势。

能证明什么 / 不能证明什么

平台可以证明:某条审定事实是否体现在某次模型回答中;模型有没有正确提及品牌; 回答与标准事实的一致程度;回答是否提供可追溯引用;多次、跨模型、跨月份监测后结果是否改善。
平台不能仅凭回答内容证明某条语料已经进入模型训练参数。对于没有引用、检索日志或模型方回执的封闭模型, 应使用「回答体现」「事实匹配」「AI 认知表现」等词, 不使用「已被模型收录」「已进入模型知识库」。
只有出现以下证据之一,才能进一步表述为「可验证获取或引用」:模型回答明确引用平台页面或 API; 平台检索服务留有对应调用日志;模型方提供知识库同步、抓取或接入回执;甲方与模型平台建立正式数据接入或 RAG 检索合作。

每次检测保存的记录

run_id run_20260919_001 | brand_id brand_huawei | question_id q_history_001 | question_version v1.2
platform kimi | model_label 页面实际显示的模型名称 | tested_at 2026-09-19T10:00:00+08:00
response_text 原始回答全文(已保存)| citations [] | target_fact_ids [F-001, F-002, F-004, F-018, F-GEO-018]
matched_fact_ids [F-001, F-004, F-002] | missing_fact_ids [F-018] | conflict_fact_ids [F-GEO-018]
mention_status mentioned | review_status machine_scored / pending_human → 看板状态分 机器初判 / 待人工复核 / 已复核,不把自动评分直接当作最终结论
sampling_context session_type=new_session | run_index=1 | locale=zh-CN

与极海空间监测的关系

极海的空间数据不是孤立的地图卖点,而是 AI 认知验证中的一种独有事实源:AI 回答"全国已有多少家门店", 平台可用空间快照核验;AI 回答"覆盖哪些城市",平台可逐城市核验;现实点位变化后,平台能发现旧回答已经过时; 核验后的空间事实重新发布,并进入下一轮模型检测。

现实世界 → 极海空间观测 → 审定事实语料
审定事实语料 → AI 回答监测 → 差距任务 → 持续更新
两条证据链相互加强:品牌现实观察窗负责发现和维护事实, 本页负责证明这些事实是否已在 AI 回答中产生效果。
数据性质声明:本页为演示环境——指标数值、平台卡片、回答比对与问题集为演示样本,用于展示正式版的指标定义、 检测口径与处理流程;指标定义、可证明边界、记录字段与任务分类为真实设计。 正式版每次检测保存原始问题、原始回答、时间、页面显示的模型名称、引用、匹配/缺失/冲突事实与人工复核状态。