Repository
eval-library
Verified repositoryBraintrust eval skills library
24
skills
Aug 20
updated
Skills from this repository
Search the skills in this repository.
Showing 24 skills from Braintrust/eval-library
braintrust-analyze-eval-experiment
analyze LLM and agent eval experiments
Aug 20AnalysisBraintrustEvalsLLM +1braintrust-attribute-multi-variable-change
attribute performance changes to multiple variables
Aug 20AnalysisBraintrustEvalsLLM +1braintrust-build-eval-dataset
create and manage LLM eval datasets
Aug 20AgentsBraintrustDatasetsEvals +1braintrust-define-eval-objective
define LLM evaluation objectives
Aug 20BraintrustEvalsLLMProduct Management +1braintrust-define-eval-release-gate
configure release gates for LLM applications
Aug 20AgentsBraintrustCI/CDEvals +1braintrust-deploy-evaluator
deploy evaluators to Braintrust
Aug 20BraintrustDeploymentEvalsbraintrust-design-eval-experiment
design controlled LLM eval experiments
Aug 20BraintrustEvalsExperimentsLLM +1braintrust-design-eval-instrumentation
design trace and evaluation dataset schemas
Aug 20BraintrustDatasetsEvalsObservability +1braintrust-design-eval-metric-bundle
create multi-objective evaluation metric bundles
Aug 20AgentsBraintrustEvalsLLM +1braintrust-design-human-eval-review
design human evaluation and review workflows
Aug 20AgentsBraintrustDatasetsEvals +1braintrust-discover-agent-failures
identify and classify agent failure modes
Aug 20AgentsBraintrustDebuggingEvals +1braintrust-discover-trace-topics
deploy trace topic discovery pipelines
Aug 20BraintrustData PipelineEvalsLLM +1braintrust-elicit-eval-criteria
extract and define evaluation criteria
Aug 20BraintrustEvalsIdeationLLM +1braintrust-eval
execute Braintrust evaluation experiments
Aug 20BraintrustEvalsTestingbraintrust-map-eval-evidence
create and audit evaluation evidence maps
Aug 20AnalysisBraintrustEvalsbraintrust-monitor-production-evals
monitor production LLM and agent evaluations
Aug 20AgentsBraintrustEvalsLLM +2braintrust-plan-agent-eval
plan evaluation workflows for LLM applications
Aug 20BraintrustEvalsLLMbraintrust-probe-capability-and-variability
probe system capability and output variability
Aug 20BenchmarkingBraintrustEvalsExperiments +1braintrust-red-team-agent
run adversarial red team testing
Aug 20BraintrustEvalsSecuritybraintrust-report-eval-results
generate technical eval reports
Aug 20AnalysisBraintrustDocumentationEvals +1braintrust-size-eval-dataset
calculate evaluation dataset sample sizes
Aug 20BraintrustEvalsStatisticsbraintrust-validate-eval-scorer
validate automated eval scorers
Aug 20BraintrustDebuggingEvalsLLM +1braintrust-write-agent-behavior-spec
define and manage agent behavior specifications
Aug 20AgentsBest PracticesBraintrustDocumentation +1braintrust-write-eval-scorer
design and implement LLM eval scorers
Aug 20AgentsBraintrustCode AnalysisEvals +1
