A test run is a single execution of a benchmark test using a defined model configuration.
Each run represents how a particular large language model (LLM) — such as GPT-4, Claude-3, or Gemini — performed on a given task at a specific time, with specific settings.
A test run includes:
Together, test runs make it possible to compare models, providers, and configurations across benchmarks in a transparent and reproducible way.
manuscript transcription handwritten 15 de prose
anthropic claude-sonnet-5-5 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
anthropic claude-opus-5-5 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
scicore Qwen3.8-Flash-Next-FP8 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
anthropic claude-fable-5-1 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
anthropic claude-sonnet-5-5 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
openai gpt-6-luna · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
anthropic claude-opus-5-5 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
openai gpt-6-sol · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
x-ai grok-4.7 · temp 0.0 · dataclass Document
manuscript transcription handwritten 15 de prose
openrouter z-ai/glm-5.3-flash · temp 0.0 · dataclass Document