Zuhause Persönliche Finanzen Vorbereiten der Daten für Predictive Analytics - Dummies

Vorbereiten der Daten für Predictive Analytics - Dummies

Inhaltsverzeichnis:

Video: Datenvorbereitung für erfolgreiche Analysen mit SAP Predictive Analytics 2024

Video: Datenvorbereitung für erfolgreiche Analysen mit SAP Predictive Analytics 2024
Anonim

Wenn Sie die Ziele des Modells definiert haben, besteht der nächste Schritt in der Vorhersageanalyse darin, die Daten zu ermitteln und vorzubereiten, die Sie zum Erstellen Ihres Modells verwenden. Die folgenden Informationen betreffen die wichtigsten Aktivitäten. Die allgemeine Reihenfolge der Schritte sieht wie folgt aus:

  1. Identifizieren Sie Ihre Datenquellen.

    Daten können in verschiedenen Formaten vorliegen oder sich an verschiedenen Orten befinden.

  2. Identifizieren Sie, wie Sie auf diese Daten zugreifen werden.

    Manchmal müssen Sie Daten von Drittanbietern oder Daten von anderen Abteilungen in Ihrer Organisation usw. erwerben.

  3. Überlegen Sie, welche Variablen in Ihre Analyse einbezogen werden sollen.

    Ein Standardansatz besteht darin, mit einer großen Bandbreite von Variablen zu beginnen und diejenigen zu eliminieren, die keinen prädiktiven Wert für das Modell bieten.

  4. Bestimmen Sie, ob abgeleitete Variablen verwendet werden sollen.

    In vielen Fällen hätte eine abgeleitete Variable (wie z. B. das für die Analyse von Aktienkursen verwendete Preis-Leistungsverhältnis) eine größere direkte Auswirkung auf das Modell als die Rohvariable.

  5. Informieren Sie sich über die Qualität Ihrer Daten, um deren Status und Einschränkungen zu verstehen.

    Die Genauigkeit der Vorhersagen des Modells hängt direkt mit den von Ihnen ausgewählten Variablen und der Qualität Ihrer Daten zusammen. Sie möchten an dieser Stelle einige datenbezogene Fragen beantworten:

    • Sind die Daten vollständig?
    • Hat es irgendwelche Ausreißer?
    • Müssen die Daten bereinigt werden?
    • Müssen Sie fehlende Werte ausfüllen, behalten, wie sie sind, oder sie ganz löschen?

Wenn Sie Ihre Daten und ihre Eigenschaften verstehen, können Sie den Algorithmus auswählen, der beim Erstellen Ihres Modells am nützlichsten ist. Zum Beispiel:

  • Regressionsalgorithmen können verwendet werden, um Zeitreihendaten zu analysieren.
  • Klassifikationsalgorithmen können verwendet werden, um diskrete Daten zu analysieren.
  • Assoziationsalgorithmen können für Daten mit korrelierten Attributen verwendet werden.

Individuelle Algorithmen und prädiktive Techniken haben unterschiedliche Schwächen und Stärken. Am wichtigsten ist, dass die Genauigkeit des Modells auf einer großen Datenmenge und Datenqualität beruht. Ihre Daten sollten eine ausreichende Anzahl von Datensätzen enthalten, um statistisch aussagekräftige Ergebnisse zu liefern.

Das Sammeln relevanter Daten (vorzugsweise vieler Datensätze über einen langen Zeitraum), das Vorverarbeiten und das Extrahieren der Features mit den meisten voraussagenden Werten sind dort, wo Sie den Großteil Ihrer Zeit verbringen. Aber Sie müssen immer noch den Algorithmus klug wählen, ein Algorithmus, der für das Geschäftsproblem geeignet sein sollte.

Die Datenvorbereitung ist spezifisch für das Projekt, an dem Sie arbeiten, und den Algorithmus, den Sie verwenden möchten.Abhängig von den Projektanforderungen werden Sie Ihre Daten entsprechend vorbereiten und dem Algorithmus zuführen, während Sie Ihr Modell erstellen, um die Geschäftsanforderungen zu erfüllen.

Der zum Trainieren und Testen des Modells verwendete Datensatz muss relevante Geschäftsinformationen enthalten, um das Problem zu lösen, das Sie lösen möchten. Wenn es Ihr Ziel ist (zum Beispiel) zu bestimmen, welcher Kunde abwanderungsbereit ist, muss der Datensatz, den Sie auswählen, Informationen über Kunden enthalten, die in der Vergangenheit gewirkt haben, sowie Kunden, die dies nicht getan haben.

Einige Modelle, die erstellt wurden, um Daten zu gewinnen und die zugrundeliegenden Beziehungen zu verstehen - beispielsweise solche, die mit Clustering-Algorithmen erstellt wurden - müssen kein bestimmtes Endergebnis berücksichtigen.

Unterlegen

Unter Anpassung ist, wenn Ihr Modell keine Beziehungen in Ihren Daten erkennt. Dies ist normalerweise ein Hinweis darauf, dass wesentliche Variablen - solche mit Vorhersagekraft - nicht in Ihre Analyse einbezogen wurden.

Wenn die in Ihrem Modell verwendeten Variablen keine hohe Vorhersagekraft haben, fügen Sie neue domänenspezifische Variablen hinzu und führen Sie das Modell erneut aus. Das Endziel besteht darin, die Leistung des Modells auf den Trainingsdaten zu verbessern.

Ein weiteres Problem, auf das Sie achten sollten, ist Saisonalität (wenn Sie saisonale Muster haben, können Sie mehrere Jahreszeiten analysieren, wenn Sie Probleme bekommen.) Zum Beispiel eine Bestandsanalyse, die nur Daten eines Bullen enthält. Der Markt (in dem die Gesamtaktienkurse steigen) berücksichtigt keine Krisen oder Blasen, die größere Korrekturen an der Gesamtperformance der Aktien bewirken können. Wenn Daten nicht berücksichtigt werden, die sowohl Bull als auch Bärenmärkte umfassen (wenn die Gesamtaktienkurse fallen), bleibt das Modell von der bestmöglichen Portfolioauswahl abhängig.

Überanpassung

Überanpassung ist, wenn Ihr Modell Daten enthält, die keine Vorhersagekraft haben, aber nur für den Datensatz, den Sie analysieren, spezifisch ist. Rauschen - zufällige Variationen im Dataset - kann in das Modell einfließen, sodass das Ausführen des Modells in einem anderen Datensatz zu einem deutlichen Rückgang der Vorhersageleistung und -genauigkeit des Modells führt.

Vorbereiten der Daten für Predictive Analytics - Dummies

Die Wahl des Herausgebers

Netzwerkgrundlagen: IPv6-Adresse Vereinfachte Notation - Dummies

Netzwerkgrundlagen: IPv6-Adresse Vereinfachte Notation - Dummies

Bei der Arbeit mit IPv6-Adressen kann es viel Zeit in Anspruch nehmen. schreibe deine Adressen - immerhin sind sie 128 Bit lang. Um das Leben einfacher zu machen, gibt es einige Regeln, die Sie verwenden können, um diese Schreibweise zu verdichten: Führende Nullen in der Adresse sind optional. Für einen Adressblock wäre also 0A45 gleich A45, ...

Netzwerkgrundlagen: IP-Netzwerkklassen - Dummies

Netzwerkgrundlagen: IP-Netzwerkklassen - Dummies

Netzwerkadressierungsarchitektur unterteilt den Adressraum für Internet Protocol Version 4 (IPv4 ) in fünf Adressklassen. Jede Klasse, die in den ersten vier Bits der Adresse codiert ist, definiert entweder eine andere Netzwerkgröße, d.h. e. Anzahl der Hosts für Unicast-Adressen (Klassen A, B, C) oder Multicast-Netzwerk (Klasse D). Die fünfte Klasse (E) address ...

Netzwerkgrundlagen: Netzwerkport Übersicht - Dummys

Netzwerkgrundlagen: Netzwerkport Übersicht - Dummys

In TCP / IP- und UDP-Netzwerken ist ein Port ein Endpunkt eine logische Verbindung. Die Portnummer gibt an, um welchen Port es sich handelt. Port 80 wird beispielsweise für HTTP-Datenverkehr verwendet. Wenn Sie einen Befehl wie netstat -n unter Microsoft Windows oder Linux verwenden, sehen Sie eine Auflistung der lokalen Adressen ...

Die Wahl des Herausgebers

Excel-Dashboards: Wie Sie Ihr erstes Makro aufzeichnen - Dummies

Excel-Dashboards: Wie Sie Ihr erstes Makro aufzeichnen - Dummies

Wenn Sie ein Anfänger auf dem Dashboard sind Automatisierung in Excel ist es unwahrscheinlich, dass Sie den VBA-Code (Visual Basic für Applikationen) von Hand schreiben können, um Makros zu erstellen. Ohne vollständige Kenntnis des Objektmodells und der Syntax von Excel wäre das Schreiben des benötigten Codes für die meisten Anfänger unmöglich. Hier können Sie ein Makro aufzeichnen ...

Excel-Formelberechnungsmodi - Dummys

Excel-Formelberechnungsmodi - Dummys

Standardmäßig ist Excel so eingestellt, dass es automatisch neu berechnet wird. Wenn Sie eine der Zellen ändern, auf die in einer bestimmten Formel verwiesen wird, berechnet Excel diese Formel automatisch neu, sodass ein korrektes Ergebnis basierend auf den Änderungen in den Zellbezügen zurückgegeben wird. Wenn die Formel, die neu berechnet wird, auch als Zellenreferenz in anderen verwendet wird ...

Excel Formelfehler - Dummies

Excel Formelfehler - Dummies

Es ist nicht immer glatt, wenn Sie mit Excel-Formeln arbeiten. Manchmal gibt eine Formel einen Fehlerwert anstelle des erwarteten Werts zurück. Excel hilft Ihnen, das Problem zu identifizieren, indem Sie einen von sieben Fehlerwerten zurückgeben: # DIV / 0! , # N / A, #NAME? , #NULL! , #NUM! , #REF! und #WERT! , erklärt in der folgenden Liste: # DIV / 0! : ...

Die Wahl des Herausgebers

Teilen, Weiterverbreiten und Kommentieren von Google+ Posts - Dummies

Teilen, Weiterverbreiten und Kommentieren von Google+ Posts - Dummies

, Wenn Sie mit der Verwendung und Veröffentlichung beginnen Bei Google+ möchten Sie gelegentlich Links und Bilder teilen, die Beiträge anderer freigeben, ihre Beiträge kommentieren und andere in Ihren eigenen Google+ Beiträgen erwähnen. Vielleicht fragen Sie sich auch, wie Sie andere dazu bringen, Ihre eigenen Beiträge öfter zu kommentieren. Teilen von Links und Bildern in Google+ So geben Sie ein ...

Teilen Ihrer Google+ Posts mit bestimmten Personen - Dummies

Teilen Ihrer Google+ Posts mit bestimmten Personen - Dummies

Beiträge auf Google+ sind ganz einfach und können posten Text, Links, Fotos, Videos und sogar Ihren aktuellen Standort. Der schwierigste Teil des Beitrags auf Google+ besteht darin, auszuwählen, wen Sie Ihren Beitrag sehen möchten. Google+ verwendet Ihre Kreise, um festzulegen, wer Ihre Beiträge sehen kann. Kreise sind etwas einfacher als Listen, weil ...

Taggen von Personen in Google+ Fotos - Dummies

Taggen von Personen in Google+ Fotos - Dummies

Sie können Personen in Ihren Kreisen auf jedem Foto auf Google+ markieren. Wenn Sie eine Person in einem Foto taggen, wird diese Person über ihre Google+ Benachrichtigungen benachrichtigt. Sie können dann das Tag entfernen oder genehmigen, und das Foto wird mit dem Tag des Namens dieser Person darin angezeigt. Um jemanden zu markieren, ...