Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Verfügbare Benchmark-Aufgaben
Es ist ein Beispielcodepaket verfügbar, das zeigt, wie Benchmark-Metriken mithilfe der Funktion zur Bewertung von SageMaker KI-Modellen für Amazon Nova berechnet werden. Informationen zum Zugriff auf die Codepakete finden Sie unter sample- Nova-lighteval-custom-task
Hier finden Sie eine Liste unterstützter, verfügbarer Industriestandard-Benchmarks. Sie können die folgenden Benchmarks für den Parameter eval_task angeben:
Benchmark |
Modalität |
Description |
Kennzahlen |
Strategie |
Unteraufgabe verfügbar |
|---|---|---|---|---|---|
mmlu |
Text |
Multi-task Sprachverständnis — Testet das Wissen in 57 Fächern. |
Richtigkeit |
zs_cot |
Ja |
mmlu_pro |
Text |
MMLU – professioneller Bereich – konzentriert sich auf Fachbereiche wie Recht, Medizin, Rechnungswesen und Ingenieurwesen. |
Richtigkeit |
zs_cot |
Nein |
bbh |
Text |
Fortschrittliche Argumentationsaufgaben – eine Sammlung herausfordernder Probleme, die kognitive Fähigkeiten und Fähigkeiten zur Problemlösung auf höherem Niveau auf die Probe stellen. |
Richtigkeit |
zs_cot |
Ja |
gpqa |
Text |
Beantwortung allgemeiner Fragen zur Physik – beurteilt das Verständnis physikalischer Konzepte und die damit verbundenen Fähigkeiten zur Problemlösung. |
Richtigkeit |
zs_cot |
Nein |
math |
Text |
Mathematische Problemlösung – bewertet mathematische Überlegungen in verschiedenen Themenbereichen wie Algebra, Infinitesimalrechnung und Textaufgaben. |
exact_match |
zs_cot |
Ja |
strong_reject |
Text |
Quality-Control Aufgabe — Testet die Fähigkeit des Modells, unangemessene, schädliche oder falsche Inhalte zu erkennen und abzulehnen. |
deflection |
zs |
Ja |
IFEval |
Text |
Instruction-Following Bewertung — Misst, wie genau ein Modell gegebene Anweisungen befolgt und Aufgaben gemäß den Spezifikationen erledigt. |
Richtigkeit |
zs |
Nein |
gen_qa |
Text |
Benutzerdefinierte Datensatzbewertung – Ermöglicht es Ihnen, Ihren eigenen Datensatz für das Benchmarking zu verwenden und Modellergebnisse mit Referenzantworten anhand von Metriken wie ROUGE und BLEU zu vergleichen. |
all |
gen_qa |
Nein |
llm_judge |
Text |
LLM-as-a-Judge Präferenzvergleich — Ermittelt anhand eines Amazon Nova Judge-Modells die Präferenz zwischen Antwortpaaren (B im Vergleich zu A) für Ihre Prompts und berechnet die Wahrscheinlichkeit, dass B gegenüber A bevorzugt wird. |
all |
judge |
Nein |
humaneval |
Text |
HumanEval — Ein Benchmark-Datensatz zur Bewertung der Funktionen zur Codegenerierung großer Sprachmodelle |
pass@1 |
zs |
Nein |
|
mm_llm_judge |
Multi-modal (Bild) |
Dieser neue Benchmark verhält sich genauso wie der oben aufgeführte textbasierte |
all |
judge |
Nein |
|
rubric_llm_judge |
Text |
Rubrik Judge ist ein erweitertes LLM-as-a-judge Bewertungsmodell, das auf Amazon Nova 2.0 Lite basiert. Im Gegensatz zum ursprünglichen Richtermodell |
all |
judge |
Nein |
|
aime_2024 |
Text |
AIME 2024 — Probleme bei der American Invitational Mathematics Examination, bei der fortgeschrittenes mathematisches Denken und Problemlösen getestet werden |
exact_match |
zs_cot |
Nein |
|
Kalender_Terminplanung |
Text |
Natural Plan — Kalenderplanung, Aufgabentests, Planungsfunktionen für die Planung von Besprechungen über mehrere Tage und mehrere Personen |
exact_match |
fs |
Nein |
Die folgenden mmlu-Unteraufgaben sind verfügbar:
MMLU_SUBTASKS = [ "abstract_algebra", "anatomy", "astronomy", "business_ethics", "clinical_knowledge", "college_biology", "college_chemistry", "college_computer_science", "college_mathematics", "college_medicine", "college_physics", "computer_security", "conceptual_physics", "econometrics", "electrical_engineering", "elementary_mathematics", "formal_logic", "global_facts", "high_school_biology", "high_school_chemistry", "high_school_computer_science", "high_school_european_history", "high_school_geography", "high_school_government_and_politics", "high_school_macroeconomics", "high_school_mathematics", "high_school_microeconomics", "high_school_physics", "high_school_psychology", "high_school_statistics", "high_school_us_history", "high_school_world_history", "human_aging", "human_sexuality", "international_law", "jurisprudence", "logical_fallacies", "machine_learning", "management", "marketing", "medical_genetics", "miscellaneous", "moral_disputes", "moral_scenarios", "nutrition", "philosophy", "prehistory", "professional_accounting", "professional_law", "professional_medicine", "professional_psychology", "public_relations", "security_studies", "sociology", "us_foreign_policy", "virology", "world_religions" ]
Die folgenden bbh-Unteraufgaben sind verfügbar:
BBH_SUBTASKS = [ "boolean_expressions", "causal_judgement", "date_understanding", "disambiguation_qa", "dyck_languages", "formal_fallacies", "geometric_shapes", "hyperbaton", "logical_deduction_five_objects", "logical_deduction_seven_objects", "logical_deduction_three_objects", "movie_recommendation", "multistep_arithmetic_two", "navigate", "object_counting", "penguins_in_a_table", "reasoning_about_colored_objects", "ruin_names", "salient_translation_error_detection", "snarks", "sports_understanding", "temporal_sequences", "tracking_shuffled_objects_five_objects", "tracking_shuffled_objects_seven_objects", "tracking_shuffled_objects_three_objects", "web_of_lies", "word_sorting" ]
Die folgenden math-Unteraufgaben sind verfügbar:
MATH_SUBTASKS = [ "algebra", "counting_and_probability", "geometry", "intermediate_algebra", "number_theory", "prealgebra", "precalculus", ]