Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Die Leistung von Amazon-Bedrock-Ressourcen bewerten
Verwenden Sie Amazon-Bedrock-Bewertungen, um die Leistung und Effektivität von Amazon-Bedrock-Modellen und Wissensdatenbanken sowie von Modellen und Retrieval Augmented Generation (RAG)-Quellen außerhalb von Amazon Bedrock zu bewerten. Amazon Bedrock kann Leistungsmetriken wie die semantische Robustheit eines Modells und die Richtigkeit einer Wissensdatenbank beim Abrufen von Informationen und Generieren von Antworten berechnen. Bei Modellevaluationen können Sie auch ein Team von Mitarbeitern einsetzen, um sie zu bewerten und ihre Beiträge für die Bewertung bereitzustellen.
Automatische Bewertungen, einschließlich Evaluationen, bei denen Large Language Models (LLMs) verwendet werden, liefern berechnete Ergebnisse und Metriken, anhand derer Sie die Effektivität eines Modells und einer Wissensdatenbank beurteilen können. Human-based Bei Evaluationen wird ein Team von Personen eingesetzt, die ihre Bewertungen und Präferenzen in Bezug auf bestimmte Kennzahlen angeben.
- Aufgaben zur Bewertung programmatischer Modelle
-
Mit Aufgaben zur programmatischen Modellevaluierung können Sie schnell beurteilen, ob ein Modell in der Lage ist, eine Aufgabe auszuführen. Sie können entweder Ihren eigenen benutzerdefinierten Prompt-Datensatz bereitstellen, den Sie auf einen bestimmten Anwendungsfall zugeschnitten haben, oder Sie können einen verfügbaren integrierten Datensatz verwenden.
- Modellieren Sie Aufgaben zur Evaluierung, bei denen menschliche Mitarbeiter zum Einsatz kommen
-
Aufträge zur Modellbewertung, bei denen menschliche Mitarbeiter eingesetzt werden, ermöglichen es Ihnen, menschliche Eingaben in den Modellbewertungsprozess einzubringen. Dies können Mitarbeiter Ihres Unternehmens oder eine Gruppe von Fachexperten aus Ihrer Branche sein.
- Modellieren Sie Bewertungsjobs, die ein Judge-Modell verwenden
-
Modellevaluierungsaufträge, die ein Judge-Modell verwenden, ermöglichen es Ihnen, die Antworten eines Modells mithilfe eines zweiten LLM schnell zu bewerten. Das zweite LLM bewertet jede Antwort und liefert eine Erklärung dazu.
- RAG-Evaluationen, die Large Language Models (LLMs) verwenden
-
LLM-based Evaluationen berechnen Leistungskennzahlen für die Wissensdatenbank. Die Metriken zeigen, ob eine RAG-Quelle oder Amazon Bedrock Knowledge Base in der Lage ist, hochrelevante Informationen abzurufen und sinnvolle, passende Antworten zu generieren. Sie stellen einen Datensatz bereit, der die Prompts oder Benutzeranfragen enthält, anhand derer bewertet werden kann, wie eine Wissensdatenbank Informationen abruft und Antworten auf diese Anfragen generiert. Der Datensatz muss auch Referenzdaten (Ground Truth) oder die erwarteten abgerufenen Texte und Antworten auf die Anfragen enthalten, damit bei der Bewertung überprüft werden kann, ob Ihre Wissensdatenbank den Erwartungen entspricht.
Unterstützung von Aufträgen zur Modellbewertung mit folgenden Amazon-Bedrock-Modelltypen:
-
Basismodelle
Modelle von Amazon Bedrock Marketplace
-
Benutzerdefinierte Basismodelle
-
Importierte Basismodelle
-
Prompt-Router
-
Modelle, für die Sie bereitgestellten Durchsatz erworben haben
Themen
Erstellen eines automatischen Auftrags zur Modellbewertung in Amazon Bedrock
Erstellen eines Auftrags zur Modellbewertung mit menschlichen Mitarbeitenden in Amazon Bedrock
Die Modellleistung mit einem anderen LLM-as-a-Judge bewerten
Die Leistung von RAG-Quellen mithilfe von Amazon-Bedrock-Bewertungen auswerten
Erforderliche Cross Origin Resource Sharing (CORS)-Berechtigungen für S3-Buckets
Überprüfen der Berichte zu Modellbewertungsaufträgen und Metriken in Amazon Bedrock
Datenverwaltung und -verschlüsselung in Amazon-Bedrock-Bewertungsaufträgen