Skip to main content
运行评估需要三个主要部分:
  1. 一个包含测试输入和预期输出的数据集
  2. 一个待评估的目标函数。
  3. 用于为目标函数输出打分的评估器
本指南将根据您要评估的应用程序部分,展示如何定义目标函数。关于如何创建数据集如何定义评估器,请参阅此处;关于运行评估的端到端示例,请参阅此处。

目标函数签名

为了在代码中评估一个应用程序,我们需要一种运行该应用程序的方式。在使用 evaluate()Python / JavaScript)时,我们将通过传入一个目标函数参数来实现。这是一个接收数据集示例的输入,并将应用程序输出作为字典返回的函数。在此函数中,我们可以按需调用我们的应用程序。我们也可以按需格式化输出。关键在于,我们定义的任何评估器函数都应与我们目标函数返回的输出格式兼容。
evaluate() 将自动追踪您的目标函数。这意味着如果您在目标函数中运行任何可追踪的代码,这些代码也将作为目标追踪的子运行被追踪。

示例:单个 LLM 调用

示例:非 LLM 组件

示例:应用程序或智能体

如果您有一个 LangGraph/LangChain 智能体,它接受数据集中定义的输入,并返回您希望在评估器中使用的输出格式,您可以直接将该对象作为目标传入: