Amazon Forecast ist für Neukunden nicht mehr verfügbar. Bestehende Kunden von Amazon Forecast können den Service weiterhin wie gewohnt nutzen. Erfahren Sie mehr“
Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Datensätze importieren
Datasets enthalten die Daten, die zum Trainieren eines Predictors verwendet werden. Sie erstellen einen oder mehrere Amazon Forecast-Datensätze und importieren Ihre Trainingsdaten in diese. Eine Datensatzgruppe ist eine Sammlung von ergänzenden Datensätzen, in denen eine Reihe sich ändernder Parameter über einen Zeitraum detailliert beschrieben wird. Nachdem Sie eine Dataset-Gruppe erstellt haben, verwenden Sie sie zum Schulen eines Predictors.
Jede Dataset-Gruppe kann bis zu drei Datasets enthalten, eines von jedem Dataset-Typ: Ziel-Zeitreihen, verwandte Zeitreihen und Artikel-Metadaten.
Um Prognose-Datensätze und Datensatzgruppen zu erstellen und zu verwalten, können Sie die Prognose-Konsole AWS Command Line Interface (AWS CLI) oder AWS das SDK verwenden.
Ein Beispiel für Prognose-Datensätze finden Sie im Amazon GitHub Forecast-Beispiel-Repository.
Themen
Datensätze
Um Prognose-Datensätze zu erstellen und zu verwalten, können Sie die Forecast-APIs verwenden, einschließlich der Operationen CreateDataset undDescribeDataset. Eine vollständige Liste der Prognose-APIs finden Sie unterAPI-Referenz.
Beim Erstellen eines Datasets geben Sie u. a. folgende Informationen an:
-
Der, frequency/interval an dem Sie Ihre Daten aufgezeichnet haben. Sie können beispielsweise Einzelhandelsartikelverkäufe jede Woche aggregieren und aufzeichnen. In der Erste Schritte-Übung verwenden Sie den durchschnittlich verbrauchten Strom pro Stunde.
-
Das Voraussageformat (die Domäne) und der Dataset-Typ (innerhalb der Domäne). Eine Datensatz-Domain gibt an, welche Art von Prognose du durchführen möchtest, während ein Datensatztyp dir hilft, deine Trainingsdaten in Forecast-friendly Kategorien zu organisieren.
-
Das Dataset-Schema Ein Schema ordnet die Spaltenüberschriften Ihres Datasets zu. Wenn Sie beispielsweise die Nachfrage überwachen, haben Sie möglicherweise stündliche Daten über den Verkauf eines Artikels in mehreren Geschäften gesammelt. In diesem Fall würde Ihr Schema die Reihenfolge von links nach rechts definieren, in der Zeitstempel, Standort und Stundensatz in Ihrer Schulungsdatendatei angezeigt werden. Schemata definieren auch den Datentyp der einzelnen Spalten, z. B.
stringoderinteger. -
Geolokalisierungs- und Zeitzoneninformationen. Das Geolocation-Attribut wird innerhalb des Schemas mit dem Attributtyp definiert.
geolocationZeitzoneninformationen werden mit dem CreateDatasetImportJob Vorgang definiert. Sowohl Geolokalisierungs- als auch Zeitzonendaten müssen enthalten sein, um den Wetterindex zu aktivieren.
Jede Spalte in Ihrem Prognose-Dataset stellt entweder eine Prognosedimension oder ein Feature dar. Prognosedimensionen beschreiben die Aspekte Ihrer Daten, die sich im Laufe der Zeit nicht ändern, z. B. store oder location Prognosefunktionen enthalten alle Parameter in Ihren Daten, die im Laufe der Zeit variieren, z. B. price oder promotion. Einige Dimensionen, z. B. timestamp oder itemId, sind in Ziel-Zeitreihen-Datasets und Datasets verwandter Zeitreihen erforderlich.
Dataset-Domänen und Dataset-Typen
Wenn Sie einen Prognosedatensatz erstellen, wählen Sie eine Domäne und einen Datensatztyp aus. Forecast stellt Domänen für eine Reihe von Anwendungsfällen bereit, z. B. für die Prognose der Einzelhandelsnachfrage oder des Internetverkehrs. Sie können auch eine benutzerdefinierte Domäne erstellen. Eine vollständige Liste der Forecast-Domains finden Sie unterVordefinierte Dataset-Domänen und Dataset-Typen.
In jeder Domain können Forecast-Benutzer die folgenden Arten von Datensätzen angeben:
-
Ziel-Zeitreihen-Datensatz (erforderlich) — Verwenden Sie diesen Datensatztyp, wenn es sich bei Ihren Trainingsdaten um eine Zeitreihe handelt und sie das Feld enthalten, für das Sie eine Prognose erstellen möchten. Dieses Feld wird als Zielfeld bezeichnet.
-
Verwandter Zeitreihen-Datensatz (optional) — Wähle diesen Datensatztyp, wenn es sich bei deinen Trainingsdaten um eine Zeitreihe handelt, die aber das Zielfeld nicht enthält. Wenn Sie beispielsweise eine Artikelnachfrage prognostizieren, kann ein Dataset verwandter Zeitreihen zwar über
priceaber nicht überdemandals Feld verfügen. -
Artikel-Metadaten-Datensatz (optional) — Wähle diesen Datensatztyp, wenn deine Trainingsdaten keine Zeitreihendaten sind, sondern Metadateninformationen zu den Elementen in der Zielzeitreihe oder verwandten Zeitreihen-Datensätzen enthalten. Wenn du beispielsweise die Nachfrage nach Artikeln prognostizierst, könnte ein Artikel-Metadaten-Datensatz eine
coloroderbrandmehrere Dimensionen haben.Forecast berücksichtigt nur die Daten, die von einem Element-Metadaten-Datensatztyp bereitgestellt werden, wenn Sie den Algorithmus CNN-QR oder DeePar+ verwenden.
Artikel-Metadaten sind besonders nützlich in Kaltstart-Prognoseszenarien, in denen Sie über wenig direkte historische Daten, anhand derer Sie Vorhersagen treffen können, verfügen, aber über historische Daten über Artikel mit ähnlichen Metadaten-Attributen. Wenn Sie Elementmetadaten einbeziehen, erstellt Forecast Kaltstartprognosen auf der Grundlage ähnlicher Zeitreihen, wodurch eine genauere Prognose erstellt werden kann.
Abhängig von den Informationen in Ihren Schulungsdaten und dem, was Sie prognostizieren möchten, können Sie mehr als ein Dataset erstellen.
Angenommen, Sie möchten eine Prognose für die Nachfrage nach Einzelhandelsartikeln wie Schuhe, Socken usw. erstellen. Es bietet sich an, die folgenden Datasets in der RETAIL-Domäne zu erstellen:
-
Ziel-Zeitreihen-Datensatz — Beinhaltet die historischen Zeitreihennachfragedaten für die Einzelhandelsartikel (
item_idtimestamp, und das Zielfeld).demandDa es das Zielfeld angibt, für das Sie eine Prognose erstellen möchten, müssen Sie mindestens ein Ziel-Zeitreihen-Dataset in einer Dataset-Gruppe haben.Sie können einem Ziel-Zeitreihen-Dataset auch bis zu zehn weitere Dimensionen hinzufügen. Wenn Sie nur ein Ziel-Zeitreihen-Dataset in Ihre Dataset-Gruppe aufnehmen, können Sie Prognosen entweder auf Artikelebene oder auf Prognosedimensionsebene erstellen. Weitere Informationen finden Sie unter CreatePredictor.
-
Verwandter Zeitreihen-Datensatz — Schließt historische Zeitreihendaten mit Ausnahme des Zielfeldes ein, wie
pricez. B. oder.revenueDamit Daten verwandter Zeitreihen den Ziel-Zeitreihen-Daten zugeordnet werden können, muss jedes Dataset verwandter Zeitreihen die dieselben identifizierenden Felder enthalten. In der RETAIL-Domäne wären dieseitem_idundtimestamp.Ein verwandtes Zeitreihen-Dataset kann Daten enthalten, die die Prognosen aus dem Zielzeitreihen-Dataset verfeinern. Sie können beispielsweise
price-Daten in Ihr Dataset verwandter Zeitreihen für zukünftige Datumsangaben einschließen, für die Sie eine Prognose generieren möchten. Auf diese Weise kann Forecast Vorhersagen mit einer zusätzlichen Kontextdimension treffen. Weitere Informationen finden Sie unter Verwenden von Datasets verwandter Zeitreihen. -
Datensatz mit Artikelmetadaten — Beinhaltet Metadaten für die Einzelhandelsartikel. Weitere Beispiele für Metadaten sind
brand,category,colorundgenre.
Beispiel-Dataset mit einer Prognosedimension
Stellen Sie sich in Anlehnung an das vorherige Beispiel vor, dass Sie die Nachfrage nach Schuhen und Socken basierend auf den vorherigen Verkäufen in einem Geschäft prognostizieren möchten. Im folgenden Ziel-Zeitreihen-Dataset ist store eine Zeitreihen-Prognosedimension, während demand das Zielfeld ist. Socks werden in zwei Filialen (NYC und SFO) verkauft, und Schuhe werden nur in ORD verkauft.
Die ersten drei Zeilen dieser Tabelle enthalten die ersten verfügbaren Verkaufsdaten für die NYC-, SFO- und ORD-Filialen. Die letzten drei Zeilen enthalten die zuletzt aufgezeichneten Verkaufsdaten für jede Filiale. Die Zeile ... stellt alle Artikelverkaufsdaten dar, die zwischen dem ersten und dem letzten Eintrag aufgezeichnet wurden.
timestamp |
item_id |
store |
demand |
|---|---|---|---|
2019-01-01 |
socks |
NYC |
25
|
2019-01-05 |
socks |
SFO |
45 |
2019-02-01 |
shoes |
ORD |
10 |
... |
|||
2019-06-01 |
socks |
NYC |
100 |
2019-06-05 |
socks |
SFO |
5 |
2019-07-01 |
shoes |
ORD |
50 |
Dataset-Schema
Jedes Dataset erfordert ein Schema, d. h. eine vom Benutzer bereitgestellte JSON-Zuweisung der Felder in Ihren Schulungsdaten. Hier listen Sie sowohl die erforderlichen als auch die optionalen Dimensionen und Funktionen auf, die Sie in Ihr Dataset aufnehmen möchten.
Wenn Ihr Datensatz ein Geolocation-Attribut enthält, definieren Sie das Attribut im Schema mit dem Attributtyp. geolocation Weitere Informationen finden Sie unter Hinzufügen von Geolocation-Informationen. Um den Wetterindex anzuwenden, müssen Sie ein Geolocation-Attribut in Ihre Zielzeitreihe und alle zugehörigen Zeitreihen-Datensätze aufnehmen.
Einige Domänen haben optionale Dimensionen, die wir empfehlen, einzubeziehen. Optionale Dimensionen werden in den Beschreibungen der einzelnen Domänen weiter unten in dieser Anleitung aufgeführt. Ein Beispiel finden Sie unter RETAIL-Domäne. Alle optionalen Dimensionen nehmen den Datentyp string an.
Für jedes Dataset ist ein Schema erforderlich. Im Folgenden finden Sie das zugehörige Schema für das obige Zielzeitreihen-Dataset.
{ "attributes": [ { "AttributeName": "timestamp", "AttributeType": "timestamp" }, { "AttributeName": "item_id", "AttributeType": "string" }, { "AttributeName": "store", "AttributeType": "string" }, { "AttributeName": "demand", "AttributeType": "float" } ] }
Wenn Sie Ihre Trainingsdaten in den Datensatz hochladen, der dieses Schema verwendet, geht Forecast davon aus, dass sich das timestamp Feld in Spalte 1, das item_id Feld in Spalte 2, das store Feld in Spalte 3 und das demand Feld, das Zielfeld, in Spalte 4 befindet.
Für den Dataset-Typ der verwandte Zeitreihen müssen alle zugehörigen Funktionen den Attributtyp Gleitkommazahl oder Ganzzahl aufweisen. Für den Artikel-Metadaten-Dataset-Typ müssen alle Funktionen den Attributtyp Zeichenfolge haben. Weitere Informationen finden Sie unter SchemaAttribute.
Anmerkung
Für jede Spalte im Datensatz ist ein attributeName attributeType UND-Paar erforderlich. Forecast reserviert eine Reihe von Namen, die nicht als Name eines Schemaattributs verwendet werden können. Die Liste der reservierten Namen finden Sie unter Reservierte Feldnamen.
Dataset-Gruppen
Eine Dataset-Gruppe ist eine Sammlung von einem bis drei verwandten Datasets, mit einem von jedem Dataset-Typ. Sie importieren Datasets in eine Dataset-Gruppe und verwenden dann die Dataset-Gruppe, um einen Predictor zu schulen.
Forecast umfasst die folgenden Operationen, um Datensatzgruppen zu erstellen und ihnen Datensätze hinzuzufügen:
Beheben von Konflikten in der Häufigkeit der Datensammlung
Forecast kann Prädiktoren mit Daten trainieren, die nicht mit der Datenfrequenz übereinstimmen, die Sie in der CreateDataset Operation angeben. Beispielsweise können Sie Daten importieren, die in stündlichen Intervallen aufgezeichnet wurden, auch wenn einige der Daten nicht am Ende der Stunde (02:20, 02:45) mit einem Zeitstempel versehen sind. Die Prognose verwendet die von Ihnen angegebene Datenfrequenz, um mehr über Ihre Daten zu erfahren. Dann aggregiert Forecast die Daten während des Prädiktortrainings. Weitere Informationen finden Sie unter Datenaggregation für verschiedene Prognosefrequenzen.