Use LLM-as-a-judge scorers
mainLLM-as-a-judge scorers use language models to evaluate outputs based on semantic understanding. They typically return a score between 0 and 1. Available scorers include:
- Factuality: Checks if the
outputis factually consistent with theexpectedground truth given aninput. - Battle: Compares
outputagainstexpectedto see which is better. - ClosedQA: Evaluates answers to closed-ended questions.
- Humor: Evaluates if the
outputis humorous. - Security: Checks for security vulnerabilities or unsafe content.
- Moderation: Uses OpenAI's moderation API to check for policy violations (sexual content, hate speech, etc.).
- Sql: Evaluates SQL query correctness.
- Summary: Evaluates the quality of text summaries.
- Translation: Evaluates translation quality.
import { Factuality } from "autoevals";
const result = await Factuality({
input: "What is the capital of France?",
output: "Paris",
expected: "The capital of France is Paris",
});
// Score: 1.0