Zuhause Persönliche Finanzen Wie man Big Data Qualität priorisiert - Dummies

Wie man Big Data Qualität priorisiert - Dummies

Video: Achieving a 360-degree view of manufacturing via open source industrial data management 2025

Video: Achieving a 360-degree view of manufacturing via open source industrial data management 2025
Anonim

Die richtige Perspektive auf Datenqualität zu bekommen, kann in der Welt der Big Data sehr herausfordernd sein. Bei den meisten großen Datenquellen müssen Sie davon ausgehen, dass Sie mit Daten arbeiten, die nicht sauber sind. In der Tat ist die überwältigende Fülle von scheinbar zufälligen und unzusammenhängenden Daten in Streams von Social-Media-Daten eines der Dinge, die es für Unternehmen so nützlich machen.

Sie suchen zunächst Petabytes an Daten, ohne zu wissen, was Sie finden könnten, nachdem Sie nach Mustern in den Daten gesucht haben. Sie müssen die Tatsache akzeptieren, dass viel Lärm in den Daten vorhanden ist. Nur durch Suchen und Mustervergleich können Sie inmitten einiger sehr schmutziger Daten Funken der Wahrheit finden.

Natürlich haben einige große Datenquellen wie Daten von RFID-Tags oder -Sensoren besser festgelegte Regeln als Social-Media-Daten. Die Sensordaten sollten einigermaßen sauber sein, obwohl Sie erwarten können, dass einige Fehler gefunden werden. Es ist immer Ihre Verantwortung, wenn Sie riesige Datenmengen analysieren, um das Qualitätsniveau dieser Daten zu planen. Sie sollten einen zweiphasigen Ansatz zur Datenqualität befolgen:

Phase 1 : Suchen Sie nach Mustern in Big Data, ohne sich um die Datenqualität zu kümmern.

Phase 2: Nachdem Sie Ihre Muster gefunden und die für das Unternehmen wichtigen Ergebnisse festgelegt haben, wenden Sie die gleichen Datenqualitätsstandards an, die Sie auf Ihre traditionellen Datenquellen anwenden. Sie möchten das Sammeln und Verwalten von Big Data vermeiden, die für das Unternehmen nicht wichtig sind, und möglicherweise andere Datenelemente in Hadoop oder anderen Big Data-Plattformen beschädigen.

Wenn Sie beginnen, die Ergebnisse Ihrer Big-Data-Analyse in Ihren Geschäftsprozess zu integrieren, müssen Sie sich bewusst sein, dass qualitativ hochwertige Daten für ein Unternehmen unerlässlich sind, um fundierte Geschäftsentscheidungen treffen zu können. Dies gilt sowohl für Big Data als auch für traditionelle Daten.

Die Datenqualität bezieht sich auf Merkmale zu den Daten, einschließlich Konsistenz, Genauigkeit, Zuverlässigkeit, Vollständigkeit, Aktualität, Angemessenheit und Gültigkeit. Datenqualitätssoftware stellt sicher, dass Datenelemente in verschiedenen Datenspeichern oder Systemen auf die gleiche Weise dargestellt werden, um die Konsistenz der Daten zu erhöhen.

Zum Beispiel kann ein Datenspeicher zwei Zeilen für eine Kundenadresse verwenden und ein anderer Datenspeicher kann eine Zeile verwenden. Dieser Unterschied in der Darstellung der Daten kann zu ungenauen Informationen über Kunden führen, z. B. wenn ein Kunde als zwei verschiedene Kunden identifiziert wird.

Ein Unternehmen kann beim Kauf von Produkten Dutzende von Variationen seines Firmennamens verwenden.Datenqualitätssoftware kann verwendet werden, um alle Variationen des Firmennamens in Ihren verschiedenen Datenspeichern zu identifizieren und sicherzustellen, dass Sie alles wissen, was dieser Kunde von Ihrem Unternehmen kauft.

Dieser Prozess wird als bezeichnet und bietet eine einzelne Ansicht des Kunden oder des Produkts. Datenqualitätssoftware passt Daten über verschiedene Systeme hinweg an und bereinigt oder entfernt redundante Daten. Der Datenqualitätsprozess liefert dem Unternehmen Informationen, die einfacher zu verwenden, zu interpretieren und zu verstehen sind.

Im Datenqualitätsprozess werden Datenprofilerstellungs-Tools verwendet, um den Inhalt, die Struktur und den Zustand Ihrer Daten zu verstehen. Sie sammeln Informationen über die Merkmale der Daten in einer Datenbank oder einem anderen Datenspeicher, um mit dem Prozess der Umwandlung der Daten in eine vertrauenswürdigere Form zu beginnen. Die Tools analysieren die Daten, um Fehler und Inkonsistenzen zu identifizieren.

Sie können Anpassungen für diese Probleme vornehmen und Fehler korrigieren. Die Tools prüfen auf akzeptable Werte, Muster und Bereiche und helfen bei der Identifizierung überlappender Daten. Beim Data-Profiling-Prozess wird beispielsweise überprüft, ob die Daten als alphanumerisch oder numerisch erwartet werden. Die Tools prüfen auch auf Abhängigkeiten oder um zu sehen, wie sich die Daten auf Daten aus anderen Datenbanken beziehen.

Data-Profiling-Tools für Big Data haben eine ähnliche Funktion wie Data-Profiling-Tools für traditionelle Daten. Data-Profiling-Tools für Hadoop liefern Ihnen wichtige Informationen über die Daten in Hadoop-Clustern. Diese Tools können verwendet werden, um nach Übereinstimmungen zu suchen und Vervielfältigungen zu entfernen. Als Ergebnis können Sie sicherstellen, dass Ihre Big Data konsistent sind. Hadoop-Tools wie HiveQL und Pig Latin können für den Transformationsprozess verwendet werden.

Wie man Big Data Qualität priorisiert - Dummies

Die Wahl des Herausgebers

Anzeigen von elektrischen Signalen an einem Oszilloskop - Dummies

Anzeigen von elektrischen Signalen an einem Oszilloskop - Dummies

Ein Oszilloskop ermöglicht das Anzeigen eines elektrischen Signals durch Anzeigen einer Spannung. variiert mit der Zeit als eine Spur über eine Anzeige. Die vertikale Achsenspannung zeigt die Größe der Spannung (auch Amplitude genannt) an, und die horizontale Achse repräsentiert die Zeit. (Denken Sie daran, Gleichungen in Mathematik-Klasse zu zeichnen? Nun, die Anzeige auf einem Bereich ist wirklich ...

Eintauchen in DX-ing - Dummies

Eintauchen in DX-ing - Dummies

Drücken Sie Ihre Station, um Kontakte über immer größere Entfernungen herzustellen (DX bedeutet entfernte Stationen ist die zweitälteste Aktivität im gesamten Amateurfunk. Irgendwo im Äther ist eine Station immer nur verlockend außer Reichweite und die Herausforderung, diese Station zu kontaktieren, ist der Zweck von DX-ing. Tausende von Schinken über ...

Steuern Sie Ihre Elektronik über einen Parallelport - Dummies

Steuern Sie Ihre Elektronik über einen Parallelport - Dummies

Werfen Sie nicht weg alter Computer! Wenn es einen Parallelport hat, können Sie damit Ihre elektronischen Gadgets steuern. Bis vor einigen Jahren waren alle Computer mit einem parallelen Anschluss ausgestattet, der hauptsächlich zum Anschluss an einen Drucker verwendet wurde. Heutzutage verbinden sich die meisten Drucker über USB-Ports mit Computern. Der Parallelport ...

Die Wahl des Herausgebers

Neuro-linguistisches Programmieren: Zu Deinem Selbst Selbst Seien Wahr - Attrappen

Neuro-linguistisches Programmieren: Zu Deinem Selbst Selbst Seien Wahr - Attrappen

Fahren nicht durch dein Leben mit einem Fuß auf der Bremse, weil du versuchst, den Erwartungen anderer Menschen gerecht zu werden. Persönliche Verantwortung und echtes Autofahren ist viel einfacher, wenn man versteht, wer man im Mittelpunkt steht und was man im Leben erreichen will. Sie können Maßnahmen ergreifen, wenn Sie ...

Bewegen Jenseits von Typ A: Abheben der Uhr - Dummies

Bewegen Jenseits von Typ A: Abheben der Uhr - Dummies

Typ A sind von der Zeit besessen. "Das nimmt zu viel Zeit in Anspruch" "Verdammt, es wird spät - ich werde nie pünktlich fertig sein." "Ich wünschte, sie würden sich beeilen. "Typ A hat ein beschleunigtes Zeitgefühl. Sie fühlen, wie die Zeit im Laufe des Tages immer mehr "abrutscht". Dies führt zu einem ...

Stimmung Störungen und ihre Behandlung Medikamente - Dummies

Stimmung Störungen und ihre Behandlung Medikamente - Dummies

Stimmungsstörungen, auch als affektive Störungen bekannt, sind eine Gruppe von Krankheiten gekennzeichnet durch eine deutliche Veränderung des emotionalen Zustandes einer Person. Die drei häufigsten Stimmungsstörungen sind bipolare Störung, Dysthymie und Major Depression. Stimmungsstörungen betreffen fast 21 Prozent der Erwachsenen in den Vereinigten Staaten. Die meisten Betroffenen finden jedoch ein gewisses Maß an ...

Die Wahl des Herausgebers

So ​​wählen Sie die von Ihnen benötigten AWS-Dienste aus - Attrappen

So ​​wählen Sie die von Ihnen benötigten AWS-Dienste aus - Attrappen

Denken Sie daran, dass Sie nur 12 Monate frei haben Entscheidungsprozess darüber, welche AWS-Dienste (Amazon Web Services) in Ihrem Unternehmen verwendet werden sollen. Zwölf Monate mögen sehr viel Zeit in Anspruch nehmen, aber Sie werden feststellen, dass es vor Ihren Augen verdunstet, wenn Sie versuchen, Ihre täglichen Aufgaben, Meetings, ... zu bewältigen.

Amazon Web Services für Dummies Cheat Sheet - Dummies

Amazon Web Services für Dummies Cheat Sheet - Dummies

Amazon Web Services (AWS) ist ein Cloud-Dienstanbieter, der bietet einfachen Zugriff auf eine Vielzahl von nützlichen Computerressourcen, die alle auf bedarfsgerechte, kosteneffiziente Weise angeboten werden. Wenn Sie ein IT-Praktiker sind, der bereit ist, Amazon Web Services zu nutzen, brechen Sie Ihre alten Anwendungsmuster-Gewohnheiten und implementieren Sie neue Ansätze, die AWS-Eigenschaften und ...

AWS-Sicherheitsprobleme - Dummies

AWS-Sicherheitsprobleme - Dummies

Für die Verwendung von AWS (Amazon Web Services) müssen Sie die Sicherheit Ihres Computers in einem Weg. Administratoren und Sicherheitsexperten können sich schnell verrückt machen, wenn sie versuchen, diese miteinander verbundenen Computer sicher zu halten, aber das ist Teil der Stellenbeschreibung. Sie müssen Best Practices bei der Sicherung der Computersysteme und der darin enthaltenen Daten befolgen.