Skip to main content
PythonTypeScript SDK 是在 LangSmith 中运行评估的推荐方式。它们包含了优化和功能,以提升性能和可靠性。 如果你无法使用 SDK——例如,如果你在使用其他语言或在受限环境中工作——你可以直接使用 REST API。本指南演示了如何使用 REST API 配合 Python 的 requests 库来运行评估,但相同的原则适用于任何语言。 在深入阅读本内容之前,建议先阅读以下内容:

创建数据集

对于此示例,我们使用 Python SDK 快速创建一个数据集。要通过 API 或 UI 创建数据集,请参考管理数据集

运行单个实验

要通过 API 运行实验,你需要:
  1. 从数据集中获取示例。
  2. 创建一个实验(在 API 中也称为“会话”)。
  3. 为每个示例创建引用该示例和实验的运行。
  4. 通过设置 end_time 来关闭实验。
首先,使用 /examples 端点拉取你希望在实验中使用的所有示例:
from langsmith import uuid7 接下来,定义一个函数,该函数将在单个示例上运行你的模型,并将结果记录到 LangSmith。直接使用 API 时,你需要负责:
  • 通过 POST 到 /runs 并设置 reference_example_idsession_id 来创建运行对象。
  • 跟踪运行之间的父子关系(例如,包含子“llm”运行的父“chain”运行)。
  • 通过 PATCH 到 /runs/{run_id} 来更新运行的输出。
现在创建实验并在所有示例上运行补全。在 API 中,“实验”表示为一个会话(或“追踪器会话”),它通过 reference_dataset_id 引用一个数据集。与常规追踪的关键区别在于,实验中的运行必须有一个 reference_example_id,将每个运行链接到数据集中的特定示例。

添加评估反馈

运行实验后,你通常希望通过添加反馈分数来评估结果。这允许你跟踪诸如正确性、准确性或任何自定义评估标准等指标。 在此示例中,评估检查每个模型的输出是否与数据集中的预期标签匹配。代码发布一个“正确性”分数(正确为 1.0,错误为 0.0),以跟踪每个模型对有毒与非有毒文本分类的准确性。 以下代码将反馈添加到单个实验示例中的运行:
你可以添加多个具有不同键的反馈分数来跟踪各种指标。例如,你可以同时添加“正确性”分数和“toxicity_detected”分数。

运行成对实验

接下来,我们将演示如何运行成对实验。在成对实验中,你将两个示例相互比较。 更多信息,请查看如何运行成对评估