SYSTEM 13/14 · THE FIELD GUIDE
Evaluation & Safety
Measuring whether models are good — and keeping them from being bad.
Evaluation Basics
Because "it looks good to me" is not a test suite.
LLM EvalsBEGINNERBuilding an Eval SuiteINTERMEDIATEGolden DatasetsBEGINNERYour First EvalBEGINNERCode vs Model vs Human GradingINTERMEDIATEEval MetricsINTERMEDIATERegression Testing PromptsINTERMEDIATEEval in CI/CDINTERMEDIATEOffline vs Online EvalsINTERMEDIATEEval Sample SizeINTERMEDIATERagas LibraryINTERMEDIATEDeepEvalINTERMEDIATEPromptfooINTERMEDIATElm-evaluation-harnessINTERMEDIATEInspect (AISI)INTERMEDIATEOpenAI EvalsINTERMEDIATE
LLM-as-a-Judge
Using models to grade models — and when to distrust the grader.
Using Models to Grade ModelsBEGINNERCommon PitfallsINTERMEDIATEJudge BiasesINTERMEDIATEPairwise vs Rubric ScoringINTERMEDIATECalibrating a JudgeINTERMEDIATEReference-Free vs Reference-BasedINTERMEDIATEChain-of-Thought JudgingINTERMEDIATEJudge vs Human AgreementADVANCEDAI Grading AIINTERMEDIATEG-EvalINTERMEDIATE
Benchmarks & Leaderboards
MMLU to SWE-bench to LMArena — what the scores mean and when they lie.
LLM BenchmarksBEGINNERChatbot Arena (LMSYS)BEGINNERCoding BenchmarksBEGINNERLMArena & Elo RatingsBEGINNERAgent BenchmarksINTERMEDIATEBenchmark ContaminationINTERMEDIATEBenchmark OverfittingINTERMEDIATEPublic vs Private BenchmarksBEGINNERReading a Benchmark ScoreBEGINNERMMLUINTERMEDIATEGPQAINTERMEDIATESWE-benchINTERMEDIATEARC-AGIINTERMEDIATEArtificial AnalysisINTERMEDIATEStanford HELMINTERMEDIATE
Red Teaming & Jailbreaks
Attack your own AI before someone else does.
Alignment & Safety Basics
Why models refuse, how they're steered, and the bigger risk map.
AI AlignmentBEGINNERMechanistic InterpretabilityADVANCEDSycophancyBEGINNERRefusals & Over-RefusalsBEGINNERSafety vs SecurityINTERMEDIATEConstitutional AIINTERMEDIATEMeasuring BiasINTERMEDIATEReward HackingINTERMEDIATESpecification GamingINTERMEDIATERLHF vs RLAIFINTERMEDIATELlama GuardINTERMEDIATEGuardrails AIINTERMEDIATENeMo GuardrailsINTERMEDIATEMicrosoft PresidioINTERMEDIATELLM GuardINTERMEDIATE