精华简报:ChatGPT Search 大规模启用 site: 操作符

来源:Simon Willison (AI 实用工程化)
文章标题:ChatGPT search now uses the site:operator at scale
链接:https://simonwillison.net/2026/Aug/20/chatgpt-search-now-uses-the-siteoperator-at-scale/


TL;DR

第三方监测工具 Promptwatch 的数据显示,在 GPT-5.6 推出前后,ChatGPT Search 内部发起的搜索查询中使用 site: 操作符的比例从长期稳定的 0.3%–0.5% 骤升至 16%–17%,时间点与 OpenAI 8 月 6 日宣布“GPT-5.6 Sol 在 Chat 中更可靠、答案更聚焦”高度吻合。Simon Willison 推测,ChatGPT 的新搜索工具内部采用了类似 search(query, recency, domains) 的函数签名,通过 domains 参数系统性地限定来源域,而非直接鼓励用户使用 site: 语法。与此同时,Promptwatch 后续报告显示 Reddit 被用作搜索来源的概率大幅下降,但 OpenAI 隐藏系统提示的做法使得外部难以确认具体机制。这一变化标志着生成式引擎优化(GEO)正在成为观察和理解 AI 搜索产品黑盒行为的关键窗口。


核心观点与技术/商业洞察

1. GEO 工具成为观察 AI 产品“不可见设计变化”的可靠信号源

Promptwatch 所处的“生成式引擎优化”(Generative Engine Optimization, GEO)领域,本质上是 SEO 在聊天机器人时代的延伸。其商业模式是帮助企业提升在 ChatGPT、Claude、Gemini 等产品回答中的曝光度。Promptwatch 通过自动化手段持续跟踪终端用户聊天产品中的提示-响应对,并发布聚合报告作为内容营销。

Simon Willison 认为,这些聚合报告“确实为那些原本不可见的产品设计变化提供了可信的线索”。这揭示了一个重要趋势:当 AI 厂商越来越不透明时,第三方监测工具正在填补信息空白,成为事实上的产品变更情报来源。

2. site: 操作符使用率激增与 GPT-5.6 发布高度时间耦合

Promptwatch 的逐日跟踪数据显示:

  • 数周内,包含 site: 操作符的 ChatGPT Search 扇出查询(fanout queries)占比稳定在 0.3%–0.5%;
  • 8 月 3 日至 5 日短暂降至 0.15%,符合分阶段推出或预发布实验的特征;
  • 8 月 8 日跳升至 16%–17%。

这一变化与 OpenAI 8 月 6 日的模糊公告——“为 Plus 和 Pro 用户更新 GPT-5.6 Sol,使其在 Chat 中更可靠地处理事实并提供更聚焦的答案”——在时间上紧密对应。Simon 指出,这种从 0.4% 到 16% 以上的量级跃迁,不可能只是用户行为自然演变,而是产品底层搜索策略发生了系统性切换。

3. 系统提示不透明下的逆向工程推断:search(query, recency, domains)

OpenAI 主动隐藏系统提示,使得外部无法直接读取 ChatGPT 搜索工具的真实定义。Simon 通过“戳探”(poking at)ChatGPT 的行为,推断其最新搜索工具的函数签名更接近:

search(query, recency, domains)

而非直接鼓励用户使用 site: 操作符。这意味着:

  • ChatGPT 可能在内部将用户意图自动转化为带 domains 限制的搜索查询;
  • domains 参数允许模型或系统根据任务需求,动态指定或排除特定网站;
  • 用户未必感知到 site: 语法,但底层搜索行为已经大规模采用域名过滤。

这一推断的商业含义是:OpenAI 正在从“通用搜索”转向“受控来源搜索”,通过内部域名白名单/黑名单机制来提升事实可靠性和答案聚焦度,而不是依赖用户手动指定来源。

4. Reddit 来源权重显著下降,但机制难以确认

8 月 18 日,Promptwatch 的后续报告指出,ChatGPT 在搜索中使用 Reddit 的可能性“大幅降低”。Simon 尝试确认系统提示是否被更新为“抑制 Reddit 来源”,但未能成功——他所知的最全面的泄露系统提示集合中,尚未出现相关变化。

这带来两个关键洞察:

  • 内容源权重的调整可能是隐式的:不一定要通过系统提示明文写入“少用 Reddit”,而可能通过 domains 参数的默认策略、检索后重排序、或模型微调来实现。
  • Reddit 作为 AI 搜索来源的地位正在被重新评估:Reddit 曾因其真实用户经验和长尾内容被视为高质量来源,但若 AI 搜索系统性减少对其引用,将直接影响 Reddit 的流量和内容生态,也可能改变其与 AI 公司的内容授权谈判地位。

5. 数据局限性:样本偏差不可忽视

Simon 特别提醒,Promptwatch 的数据“仅反映其启用自动跟踪的提示”。这意味着:

  • 样本并非随机抽样,可能存在用户群体、使用场景或地理分布上的偏差;
  • 16%–17% 的绝对值未必代表全体 ChatGPT Search 查询的真实比例;
  • 但变化趋势本身(从 0.4% 到 16% 的跃迁)仍然具有很高的信号价值,因为偏差在前后对比中相对稳定。

启发与影响

对 SEO/GEO 行业

  • GEO 监测工具的价值上升:随着 AI 搜索产品快速迭代且不透明,企业需要依赖 Promptwatch 等第三方工具来追踪自身网站在 AI 回答中的可见度变化。site: 操作符的大规模使用意味着域名级别的收录与过滤策略变得至关重要。
  • 域名权威性成为 AI 搜索优化的核心战场:如果 ChatGPT 内部通过 domains 参数筛选来源,那么网站能否进入其“可信域列表”将直接决定流量。企业需要关注自身域名的权威性、事实准确性和结构化数据质量。
  • 优化目标从关键词排名转向“被 AI 选中为来源”:传统 SEO 的排名逻辑在 AI 搜索中可能失效,GEO 需要新的指标——例如“被引用概率”“来源域出现频率”等。

对内容平台与发布者

  • Reddit 的 AI 可见度下降是一个警示信号:即使是拥有海量真实用户内容的大型平台,也可能被 AI 搜索降权。内容平台需要重新思考与 AI 公司的关系:是授权合作、技术对抗,还是建立自己的 AI 搜索入口?
  • 中小发布者面临更大不确定性:如果 AI 搜索倾向于使用少数“可信域”,中小网站可能更难获得引用。发布者需要强化专业领域权威性,或通过结构化数据、API 等方式主动向 AI 系统提供可验证的内容。

对 OpenAI 产品策略与竞争格局

  • “更聚焦、更可靠”的代价可能是来源多样性下降:通过 domains 参数限制来源,可以提升事实准确性,但也可能减少答案的多样性和社区经验价值。OpenAI 需要在可靠性与丰富性之间取得平衡。
  • 系统提示不透明催生逆向工程生态:OpenAI 隐藏系统提示的做法,反而刺激了第三方监测和逆向工程工具的发展。这种“猫鼠游戏”可能持续,但也会增加外部对产品变化的误判风险。
  • 搜索策略变化可能影响内容授权谈判:如果 ChatGPT 减少对 Reddit 的引用,Reddit 在与 OpenAI 的内容授权谈判中可能失去部分筹码;反之,被纳入“可信域”的平台将获得更大议价能力。

对用户与研究者

  • 用户可能失去对搜索来源的直接控制:过去用户可以通过 site: 语法明确指定来源,现在这一能力被内部化,用户无法直接干预。这可能提高便利性,但也降低了透明度和可解释性。
  • 研究者需要依赖多源交叉验证:单一监测工具的数据存在样本偏差,研究者应结合泄露系统提示、行为实验和多家第三方数据来还原产品变化。
  • AI 搜索的“黑盒化”呼唤更强的可审计性要求:随着 AI 搜索成为信息获取的主要入口,其来源选择机制是否公平、透明,将逐渐成为监管和公众关注的焦点。

结论:ChatGPT Search 大规模启用 site: 操作符,是 GPT-5.6 更新中一次系统性的搜索策略转变——从开放搜索转向受控域名过滤。这一变化不仅影响 Reddit 等内容平台的 AI 可见度,也标志着 GEO 工具在监测和解读 AI 产品黑盒行为方面的重要性显著上升。对于企业、发布者和研究者而言,理解并适应这种“不可见的来源治理”,将成为下一阶段 AI 搜索生态竞争的关键。