Skip to content

LangSmith 支持两种类型的评估,根据其运行的时间和地点进行区分:

评估工作流

离线评估流程
在线评估流程

创建数据集

使用来自手动整理的测试用例、历史生产追踪记录或合成数据生成的 示例 来创建一个 数据集

定义评估器

创建 评估器 来对性能进行评分: - 人工 评审 - 代码 规则 - LLM 作为裁判 - 成对 比较

运行实验

在数据集上执行你的应用程序以创建一个 实验。配置 重复次数、并发性和缓存 以优化运行。

分析结果

比较实验以进行 基准测试单元测试回归测试回测

有关离线和在线评估之间差异的更多信息,请参阅 评估概念 页面。

开始使用

要设置 LangSmith 实例,请访问平台设置部分,在云端、混合或自托管之间进行选择。所有选项都包括可观测性、评估、提示工程和部署。

LangChain 中文文档