Skip to main content
部署应用程序只是持续改进过程的开始。部署到生产环境后,您需要通过优化提示、语言模型、工具和架构来完善系统。回测涉及使用历史数据评估应用程序的新版本,并将新输出与原始输出进行比较。与使用预生产数据集进行评估相比,回测能更清晰地表明新版本应用程序是否比当前部署版本有所改进。 以下是回测的基本步骤:
  1. 从您的生产追踪项目中选择要测试的样本运行。
  2. 将运行输入转换为数据集,并将运行输出记录为该数据集的初始实验。
  3. 在新数据集上执行新系统,并比较实验结果。
此过程将为您提供一个具有代表性输入的新数据集,您可以对其进行版本控制并用于模型回测。
通常,您可能没有明确的“真实答案”可用。在这种情况下,您可以手动标注输出或使用不依赖参考数据的评估器。如果您的应用程序允许捕获真实标签(例如允许用户提供反馈),我们强烈建议这样做。

设置

配置环境

安装并设置环境变量。本指南要求 langsmith>=0.2.4
为方便起见,本教程将使用 LangChain OSS 框架,但展示的 LangSmith 功能是框架无关的。

定义应用程序

对于此示例,让我们创建一个简单的推文撰写应用程序,该应用程序可以访问一些互联网搜索工具:

模拟生产数据

现在让我们模拟一些生产数据:

将生产追踪转换为实验

第一步是基于生产输入生成数据集。然后复制所有追踪作为基线实验。

选择要回测的运行

您可以使用 list_runsfilter 参数选择要回测的运行。filter 参数使用 LangSmith 追踪查询语法 来选择运行。

将运行转换为实验

convert_runs_to_test 是一个函数,它接受一些运行并执行以下操作:
  1. 输入(以及可选的输出)作为示例保存到数据集中。
  2. 输入和输出存储为实验,就像您运行了 evaluate 函数并获得了这些输出一样。
此步骤完成后,您应该在 LangSmith 项目中看到一个名为 “Tweet Writing Task-backtesting TODAYS DATE” 的新数据集,其中包含一个实验,如下所示: 基线实验

对新系统进行基准测试

现在我们可以开始将生产运行与新系统进行基准测试的过程。

定义评估器

首先,让我们定义用于比较两个系统的评估器。请注意,我们没有参考输出,因此需要设计仅需要实际输出的评估指标。

评估基线

现在,让我们针对基线实验运行评估器。

定义并评估新系统

现在,让我们定义并评估我们的新系统。在此示例中,我们的新系统将与旧系统相同,但将使用 GPT-4o 而不是 GPT-3.5。由于我们已使模型可配置,我们只需更新传递给代理的默认配置:

比较结果

运行两个实验后,您可以在数据集中查看它们: 数据集页面 结果揭示了两个模型之间有趣的权衡:
  1. GPT-4o 在遵循格式规则方面表现更好,始终包含请求数量的表情符号
  2. 然而,GPT-4o 在基于提供的搜索结果方面可靠性较低
为了说明基于上下文的问题:在此示例运行中,GPT-4o 包含了关于 Abū Bakr Muhammad ibn Zakariyyā al-Rāzī 医学贡献的事实,但这些事实并未出现在搜索结果中。这表明它是从其内部知识中提取信息,而不是严格使用提供的信息。 这次回测练习表明,虽然 GPT-4o 通常被认为是一个更强大的模型,但简单地升级到它并不会改善我们的推文撰写器。要有效使用 GPT-4o,我们需要:
  • 优化我们的提示,更加强调仅使用提供的信息
  • 或者修改我们的系统架构,以更好地约束模型的输出
这一见解展示了回测的价值——它帮助我们在部署前识别潜在问题。 教程比较视图