跳转至

亲爱的算法:用于统一搜索与推荐的注重精度优先的智能体意图层

文章背景与核心概要

本文介绍了“亲爱的算法”(Dear Algo),这是一个在社交平台 Threads 上实际部署的智能体意图层,旨在弥合传统搜索与推荐系统之间的鸿沟。尽管搜索和推荐共享相同的核心发现目标,但它们对用户意图的编码方式传统上截然不同(例如,一次性结果列表与持续的信息流引导)。

Dear Algo 能够将显式、隐式、负面以及复合的自然语言用户请求(例如“更多 NBA 新闻”或“少一点政治内容”)编译为落地、可执行的计划,然后调用常规检索以及可选的语义或多模态重排,而无需单一、统一的服务路径或模型。通过盲测审计、请求聚类和实时服务路径研究等“精度优先”(precision-first)框架的评估,该系统展现出显著的性能提升,不仅实现了更高的精准相关(exact-relevant)准确率,还大幅降低了无关项目的入选率。


目录与参考信息


作者列表

  • Rui Wang, Jiazhou Wang, Zheng Wei, Chenglin Lu, Fangcheng Sun, Ivy Sun, Jin Sun, Hui Geng, Lillian Zhang, Chao Yang, Lei Chen, Shahin Sefati, Reem Helou, Joe Zhou, Babak Shakibi, Yiyi Pan, Bi Xue, Hong Yan, Shujian Bu

摘要

Search and recommendation serve a shared discovery objective but encode intent differently. We study this boundary through Dear Algo on Threads, a deployed product where open-ended requests such as more NBA news or less politics steer subsequent feed recommendations rather than return a one-shot result list. Its agentic intent layer compiles explicit, inferred, negative, and compound intent into a grounded executable plan, then invokes conventional retrieval and optional semantic or multimodal reranking. The layer shares an intent-to-retrieval contract without requiring one model or serving path across search-like and recommendation-like modes.

We evaluate Dear Algo under a precision-first objective. In a blinded audit of 300 public request-item pairs (296 evaluable), a strict categorical LLM-as-a-judge gate achieved 94.4% exact-Relevant precision [88.8%, 98.9%]. Across 72 normalized request clusters, the full configuration produced 7.73 judge-qualified candidates per 20 slots versus 6.61 for an LLM-derived-query baseline, a gain of 1.11 [0.12, 2.12]. In a candidate-randomized serving-path study restricted to the reranker path's first 72 eligible hours, the user-weighted judge-Irrelevant share among judged admissions was 2.80% versus 4.78% off (-1.97 points [-3.02, -0.94]), while Exact-Relevant share was 2.24 points higher [0.08, 4.41].

Together, these studies show how explicit natural-language intent can be carried into feed recommendation under a precision-first evaluation framework.

搜索和推荐服务于共同的信息发现目标,但对意图的编码方式有所不同。我们通过在 Threads 上部署的产品“亲爱的算法”(Dear Algo)来研究这一边界,在该产品中,诸如“更多 NBA 新闻”“少一点政治内容”之类的开放式请求可以引导后续的信息流推荐,而不是返回一次性的结果列表。其智能体意图层将显式、隐式、负面和复合意图编译为可落地的可执行计划,然后调用常规检索以及可选的语义或多模态重排。该层共享一个“意图到检索”的契约,在类搜索和类推荐模式之间无需单一的模型或服务路径。

我们在精度优先(precision-first)的目标下评估了 Dear Algo。在对 300 个公共请求-物品对(296 个可评估)进行的盲测审计中,严格的分类大模型作为裁判(LLM-as-a-judge)门控机制实现了 94.4% 的精确相关(exact-Relevant)准确率 [88.8%, 98.9%];在 72 个归一化的请求集群中,完整配置在每 20 个槽位中产生了 7.73 个经裁判合格的候选者,而大模型派生查询基线为 6.61 个,净增 1.11 个 [0.12, 2.12]。在限于重排路径前 72 个符合条件小时的候选随机化服务路径研究中,经用户加权的裁判判定为不相关(judge-Irrelevant)的入选比例为 2.80%,而关闭时为 4.78%(降低了 1.97 个百分点 [-3.02, -0.94]),同时精确相关(Exact-Relevant)比例高出 2.24 个百分点 [0.08, 4.41]。

总之,这些研究表明了如何在精度优先的评估框架下,将显式的自然语言意图带入信息流推荐中。


核心发现与评估结果

  1. 盲测审计(Blinded Audit): 对 296 个可评估的公共请求-物品对进行的严格分类大模型裁判评估表明,其精确相关准确率(exact-Relevant precision)达到了 94.4%(置信区间:[88.8%, 98.9%])。
  2. 集群性能(Cluster Performance): 在 72 个归一化的请求集群中,完整的 Dear Algo 配置每 20 个槽位产生 7.73 个经裁判合格的候选者,优于大模型派生查询基线(6.61 个候选者),净增 1.11 个槽位。
  3. 服务路径研究(Serving-Path Study): 在随机化的在线服务路径评估中:
  4. 用户加权的裁判判定不相关(judge-Irrelevant)占比降至 2.80%,而该层关闭时为 4.78%(绝对下降 1.97 个百分点)。
  5. 精确相关(Exact-Relevant)占比提升了 2.24 个百分点