已核验事实
发生了什么
arXiv 于 2026 年 8 月 24 日发布 Clarify-Then-Search v1;该项目是一项评估深度搜索澄清流程的基准,而不是电商平台功能或政策更新。
该基准使用来自百度搜索引擎的真实查询数据,包含 518 个经过整理的实例;每个实例对应一个意图明确的查询和一个信息不完整的查询。
评估流程包括:Clarifier 针对不完整查询提出 1、2 或 3 个问题,User Answerer 仅依据意图查询中明确写出的信息作答,Rewriter 再根据原始查询和问答内容改写查询,随后由 WebDancer 执行深度搜索。
摘要称,在所有被评估模型中,提出 1 个澄清问题通常已经优于不交互基线,增加问题预算通常还能带来进一步提升;GPT-5.2 在提出 1 个问题时平均得分最高,ERNIE-4.5-Turbo-128K 在提出 3 个问题时总体表现最高。
当前可核验内容仅来自 arXiv 页面摘要的单一来源,未保留论文正文或引语;因此,摘要没有证明该基准已被电商平台、搜索平台或商家工具正式采用。
经营影响
为什么重要
商品搜索、竞品调研和市场分析中的需求经常缺少时间、地区、范围或定义等约束;摘要将这类信息不足与检索偏移、答案不完整直接联系起来。
对依赖 AI 搜索辅助选品、广告研究或客服知识检索的商家而言,问题不只是模型能否找到信息,还包括它是否先识别出缺失条件,并把答案转化为可执行的查询。
该研究把澄清问题、用户可回答性、查询改写和最终证据找回放在同一流程中评估,提示商家不能只看 AI 是否提出了问题,还要检查后续结果是否恢复了关键事实。
编辑观察