ASSESSMENT PROTOCOL / 001

先保留原始回答,再解释变化。

评估的起点是可追溯的问题、平台、时间、回答与截图,而不是一个脱离上下文的分数。

监测流程

博枢知耀的AI搜索监测分为四个步骤,每步强调可追溯性和真实性——不是自动化生成的分数,而是可被复核的原始记录和人工判断。

01建立问题库确定每个监测问题的问题ID、目标用户角色、搜索意图类型(认知/比较/采购/执行/评估)和测试条件(平台、时间、是否登录、是否指定地域)。问题库中的问题来源于客户真实搜索场景,不是臆想的营销关键词。每个监测周期使用同一套问题库,确保对比有基准。INPUT
02保存六平台回答在豆包、DeepSeek、Kimi、腾讯元宝、千问、文心一言六个平台上,逐一输入监测问题,保存每个平台的完整原始回答文本和页面截图。六个平台的回答机制不同——有的偏好结构化列表,有的偏好多段落叙述,有的会在回答中主动引用来源链接。保存时不做任何编辑或截断,保持原始状态。RAW
03人工分析对每个平台的每条回答进行四维分析:实体准确性(AI是否正确识别企业名称和品牌,是否将企业与其他实体混淆)、内容理解度(AI对业务范围和核心能力的描述是否准确,是否遗漏关键信息)、证据来源(AI回答中引用了哪些来源,是否只有企业自述)、品牌提及(企业是否在回答中被提及,提及方式是正面引用、中立列举还是未提及)。评分不是自动化的——每个结论需要有对应的原始回答文本作为依据。REVIEW
04阶段复测在下一轮监测周期(通常按季度),使用相同的问题库和尽量一致的测试条件重新抓取六平台回答。对比同一问题在同一平台上的回答变化,判断变化方向(改善/恶化/无变化),并分析变化可能的原因——是企业信息建设起作用、平台模型更新导致、还是行业竞争格局变化。短期波动属于正常现象,重点观察多轮复测的趋势方向。COMPARE

三原色评估维度

人工分析阶段使用三原色模型的三个维度来评估AI回答质量。这不是评分排名,而是诊断框架——告诉你企业在哪个维度最弱,下一轮该重点补什么。

信息红评估检查AI是否使用了正确的企业全称、品牌简称、服务范围和联系方式。找出的问题可能是:AI把两家名称相似的企业搞混了、AI引用了过期的联系方式、AI对企业服务范围的描述与官网不一致。IDENTITY
绿内容绿评估检查AI在回答客户问题时是否引用了企业相关内容,以及引用的内容是否准确回应了问题。找出的问题可能是:AI完全没有提及企业、AI引用了企业内容但答非所问、企业有相关内容但AI没有抓取到。COMPREHENSION
信任蓝评估检查AI回答中的引用来源是否包括第三方公开信息,还是只有企业官网自述。找出的问题可能是:AI只引用了企业官网但未引用第三方来源、AI引用了错误的第三方信息、企业缺乏可被AI交叉验证的公开来源。EVIDENCE
监测平台基于第三方工具改造,可以辅助批量抓取部分平台的原始回答和截图。页面变化、登录状态和评分判断仍需人工处理,目前不承诺完全自动闭环。三原色评分体系为博枢知耀自研,用于项目内部比较,不等同于AI平台官方评价。
从四个维度观察:AI是否提及品牌名称、描述是否准确、是否有引用来源、品牌是否被纳入候选项范围。评估需记录具体问题、平台、时间和原始回答,通过阶段复测对比变化。博枢知耀使用自研三原色评分体系辅助内部比较。
企业可以自行在豆包、DeepSeek、Kimi等平台搜索自有品牌名称和行业问题,记录AI回答并保存截图。但标准化评分、跨平台对比和异常判断仍需专业知识。博枢知耀提供监测评估服务,基于第三方工具辅助数据保存。