Zuhause Persönliche Finanzen Wie man Big Data Qualität priorisiert - Dummies

Wie man Big Data Qualität priorisiert - Dummies

Video: Achieving a 360-degree view of manufacturing via open source industrial data management 2025

Video: Achieving a 360-degree view of manufacturing via open source industrial data management 2025
Anonim

Die richtige Perspektive auf Datenqualität zu bekommen, kann in der Welt der Big Data sehr herausfordernd sein. Bei den meisten großen Datenquellen müssen Sie davon ausgehen, dass Sie mit Daten arbeiten, die nicht sauber sind. In der Tat ist die überwältigende Fülle von scheinbar zufälligen und unzusammenhängenden Daten in Streams von Social-Media-Daten eines der Dinge, die es für Unternehmen so nützlich machen.

Sie suchen zunächst Petabytes an Daten, ohne zu wissen, was Sie finden könnten, nachdem Sie nach Mustern in den Daten gesucht haben. Sie müssen die Tatsache akzeptieren, dass viel Lärm in den Daten vorhanden ist. Nur durch Suchen und Mustervergleich können Sie inmitten einiger sehr schmutziger Daten Funken der Wahrheit finden.

Natürlich haben einige große Datenquellen wie Daten von RFID-Tags oder -Sensoren besser festgelegte Regeln als Social-Media-Daten. Die Sensordaten sollten einigermaßen sauber sein, obwohl Sie erwarten können, dass einige Fehler gefunden werden. Es ist immer Ihre Verantwortung, wenn Sie riesige Datenmengen analysieren, um das Qualitätsniveau dieser Daten zu planen. Sie sollten einen zweiphasigen Ansatz zur Datenqualität befolgen:

Phase 1 : Suchen Sie nach Mustern in Big Data, ohne sich um die Datenqualität zu kümmern.

Phase 2: Nachdem Sie Ihre Muster gefunden und die für das Unternehmen wichtigen Ergebnisse festgelegt haben, wenden Sie die gleichen Datenqualitätsstandards an, die Sie auf Ihre traditionellen Datenquellen anwenden. Sie möchten das Sammeln und Verwalten von Big Data vermeiden, die für das Unternehmen nicht wichtig sind, und möglicherweise andere Datenelemente in Hadoop oder anderen Big Data-Plattformen beschädigen.

Wenn Sie beginnen, die Ergebnisse Ihrer Big-Data-Analyse in Ihren Geschäftsprozess zu integrieren, müssen Sie sich bewusst sein, dass qualitativ hochwertige Daten für ein Unternehmen unerlässlich sind, um fundierte Geschäftsentscheidungen treffen zu können. Dies gilt sowohl für Big Data als auch für traditionelle Daten.

Die Datenqualität bezieht sich auf Merkmale zu den Daten, einschließlich Konsistenz, Genauigkeit, Zuverlässigkeit, Vollständigkeit, Aktualität, Angemessenheit und Gültigkeit. Datenqualitätssoftware stellt sicher, dass Datenelemente in verschiedenen Datenspeichern oder Systemen auf die gleiche Weise dargestellt werden, um die Konsistenz der Daten zu erhöhen.

Zum Beispiel kann ein Datenspeicher zwei Zeilen für eine Kundenadresse verwenden und ein anderer Datenspeicher kann eine Zeile verwenden. Dieser Unterschied in der Darstellung der Daten kann zu ungenauen Informationen über Kunden führen, z. B. wenn ein Kunde als zwei verschiedene Kunden identifiziert wird.

Ein Unternehmen kann beim Kauf von Produkten Dutzende von Variationen seines Firmennamens verwenden.Datenqualitätssoftware kann verwendet werden, um alle Variationen des Firmennamens in Ihren verschiedenen Datenspeichern zu identifizieren und sicherzustellen, dass Sie alles wissen, was dieser Kunde von Ihrem Unternehmen kauft.

Dieser Prozess wird als bezeichnet und bietet eine einzelne Ansicht des Kunden oder des Produkts. Datenqualitätssoftware passt Daten über verschiedene Systeme hinweg an und bereinigt oder entfernt redundante Daten. Der Datenqualitätsprozess liefert dem Unternehmen Informationen, die einfacher zu verwenden, zu interpretieren und zu verstehen sind.

Im Datenqualitätsprozess werden Datenprofilerstellungs-Tools verwendet, um den Inhalt, die Struktur und den Zustand Ihrer Daten zu verstehen. Sie sammeln Informationen über die Merkmale der Daten in einer Datenbank oder einem anderen Datenspeicher, um mit dem Prozess der Umwandlung der Daten in eine vertrauenswürdigere Form zu beginnen. Die Tools analysieren die Daten, um Fehler und Inkonsistenzen zu identifizieren.

Sie können Anpassungen für diese Probleme vornehmen und Fehler korrigieren. Die Tools prüfen auf akzeptable Werte, Muster und Bereiche und helfen bei der Identifizierung überlappender Daten. Beim Data-Profiling-Prozess wird beispielsweise überprüft, ob die Daten als alphanumerisch oder numerisch erwartet werden. Die Tools prüfen auch auf Abhängigkeiten oder um zu sehen, wie sich die Daten auf Daten aus anderen Datenbanken beziehen.

Data-Profiling-Tools für Big Data haben eine ähnliche Funktion wie Data-Profiling-Tools für traditionelle Daten. Data-Profiling-Tools für Hadoop liefern Ihnen wichtige Informationen über die Daten in Hadoop-Clustern. Diese Tools können verwendet werden, um nach Übereinstimmungen zu suchen und Vervielfältigungen zu entfernen. Als Ergebnis können Sie sicherstellen, dass Ihre Big Data konsistent sind. Hadoop-Tools wie HiveQL und Pig Latin können für den Transformationsprozess verwendet werden.

Wie man Big Data Qualität priorisiert - Dummies

Die Wahl des Herausgebers

Wie man Dateien in C ++ kopiert - Dummies

Wie man Dateien in C ++ kopiert - Dummies

Ah, eine Datei kopieren - etwas so einfaches, es passiert alles Zeit. Kopiere diese Datei dorthin; Kopieren Sie diese Datei hier. Aber was genau passiert, wenn Sie eine Datei kopieren? Sie erstellen tatsächlich eine neue Datei und füllen diese mit dem gleichen Inhalt wie die Originaldatei. Und wie machst du das? Nun, ...

Anleitung zum Erstellen eines Verzeichnisses in C ++ - Dummies

Anleitung zum Erstellen eines Verzeichnisses in C ++ - Dummies

Wenn Sie ein Verzeichnis erstellen möchten, können Sie das MKdir Funktion. Wenn die Funktion das Verzeichnis für Sie erstellen kann, gibt sie eine 0 zurück. Andernfalls wird ein Wert ungleich Null zurückgegeben. (Wenn Sie es ausführen, erhalten Sie eine -1, aber Ihre beste Wette - immer - ist es, gegen 0 zu testen.) Hier ist einige ...

Wie man eine einfache mathematische Vorlage in C ++ - Dummies

Wie man eine einfache mathematische Vorlage in C ++ - Dummies

Mit einer mathematischen Vorlage erstellt, die man normalerweise benötigt Zugriff auf eine Vielzahl von Berechnungen, aber nur jeweils eine oder zwei dieser Berechnungen. Zum Beispiel, wenn jemand Ihre Hypothek berechnet, muss er die Amortisationsrechnung nicht kennen. Die Person kann jedoch die Amortisationsberechnung benötigen, wenn Sie mit ...

Die Wahl des Herausgebers

ASVAB: Lesen für die Studie - Dummies

ASVAB: Lesen für die Studie - Dummies

Lesen für die Zwecke des Studiums der ASVAB ist eine andere Art des Lesens. Leseverständnis erfordert nur, dass Sie Informationen lange genug im Kurzzeitgedächtnis speichern, um einige Sekunden später eine Frage zu beantworten. Zum Lesen für die Zwecke des Studiums müssen Sie wichtige Informationen in Ihr Langzeitgedächtnis einpflegen - ...

ASVAB Mathematik Wissenspraxis: Ungleichungen - Dummies

ASVAB Mathematik Wissenspraxis: Ungleichungen - Dummies

Als wäre Algebra nicht anspruchsvoll genug, einige Fragen zur Der Subtest Mathematik auf dem ASVAB wird auch eine Ungleichheit einwerfen - nur um sicherzustellen, dass Sie aufmerksam sind. Wie erkennst du eine Ungleichheit? Halten Sie Ausschau nach Fragen mit mehr als oder weniger als Symbolen oder nach Graphen, die eine Zahlenlinie mit einem ...

ASVAB Mathematische Wissenspraxis: Fraktionen - Dummies

ASVAB Mathematische Wissenspraxis: Fraktionen - Dummies

Der Subtest Mathematikwissen auf dem ASVAB wird Fragen beinhalten, die Sie fragen mit Teilen eines Ganzen oder Fraktionen arbeiten. Diese Fragen können das Multiplizieren, Dividieren, Addieren, Subtrahieren und Konvertieren von Brüchen beinhalten, ähnlich den folgenden Übungsfragen. Übungsfragen Welche Fraktionen sind nicht gleichwertig? Gegeben einfach den Ausdruck. Antworten und Erklärungen Das richtige ...

Die Wahl des Herausgebers

Hinzufügen von Flash-Audio- und Videodateien in Dreamweaver - Dummies

Hinzufügen von Flash-Audio- und Videodateien in Dreamweaver - Dummies

Adobe besitzt sowohl Flash als auch Dreamweaver Daher finden Sie großartige Unterstützung für Flash-Dateien in Dreamweaver. Das Dialogfeld "FLV einfügen" erleichtert das Festlegen von Parametern für Flash. Dreamweaver erkennt sogar automatisch die Größe von Flash-Videodateien. Sie können Flash auch zum Erstellen und Einfügen von Audiodateien verwenden, wobei nur der Player angezeigt wird.

Einstellen von Bildhelligkeit und -kontrast in Dreamweaver - Dummies

Einstellen von Bildhelligkeit und -kontrast in Dreamweaver - Dummies

Dreamweaver bietet Werkzeuge zum Erstellen von Bildern Einstellungen, einschließlich der Helligkeit und des Kontrastes. Durch die Anpassung der Bildhelligkeit können Sie die Gesamtlichtmenge in einem Bild ändern. Kontrast steuert den Unterschied zwischen hellen und dunklen Bereichen eines Bildes. Wenn Sie die Dreamweaver-Bearbeitungswerkzeuge verwenden, wird das Bild dauerhaft geändert, wenn die Seite ...

Hinzufügen von Bildern zu Ihrer Website in Dreamweaver - Dummies

Hinzufügen von Bildern zu Ihrer Website in Dreamweaver - Dummies

Wenn Sie Ihrer Website ein Bild hinzufügen, erscheint anfangs fast magisch, weil der Prozess mit Dreamweaver so einfach ist. Die Herausforderung bei Webgrafiken besteht darin, sie nicht zu Ihren Seiten hinzuzufügen, sondern gut aussehende Bilder zu erstellen, die schnell im Browser Ihres Viewers geladen werden. Sie benötigen ein anderes Programm wie Photoshop, Photoshop Elements oder Fireworks, um ...