Hem Personliga finanser Grunderna för dataklyssningar i förklarande analyser - dummies

Grunderna för dataklyssningar i förklarande analyser - dummies

Video: Grunderna för riktigt bra wedgar 2024

Video: Grunderna för riktigt bra wedgar 2024
Anonim

A dataset < (eller datainsamling) är en uppsättning objekt i prediktiv analys. Exempelvis är en uppsättning dokument en dataset där dataelementen är dokument. En uppsättning användaruppgifter för sociala nätverk (namn, ålder, lista över vänner, bilder osv.) Är en dataset där dataelementen är profiler av sociala nätverksanvändare. Dataklypning

är uppgiften att dela en dataset i delmängder av liknande föremål. Objekt kan också hänvisas till som instanser, observationer, enheter eller dataobjekt. I de flesta fall representeras en dataset i tabellformat - en datamatris . En datamatris är en tabell med siffror, dokument eller uttryck som representeras i rader och kolumner enligt följande:

Varje rad motsvarar ett givet objekt i datasetet.
  • Rader kallas ibland som

    objekt, föremål, instanser eller observationer. Varje kolumn representerar en särskild egenskap för ett objekt.

  • Kolumner kallas

    funktioner eller attribut. Användning av dataklypning till en dataset genererar grupper av liknande dataposter. Dessa grupper heter

kluster - samlingar av liknande dataposter.

Liknande

objekt har ett starkt mätbart förhållande bland dem - färska grönsaker, till exempel, liknar varandra än de är frysta livsmedel - och klusteringstekniker använder det förhållandet till gruppen föremålen. Styrkan av ett förhållande mellan två eller flera objekt kan kvantifieras som en

likhetsåtgärd: En matematisk funktion beräknar korrelationen mellan två dataposter. Resultaten av den beräkningen, som heter likhetsvärden, jämför i huvudsak ett visst dataobjekt till alla andra objekt i datasetet. Dessa andra objekt kommer att vara antingen mer eller mindre lika i jämförelse med det specifika objektet.

Beräknade likheter spelar en viktig roll för att tilldela objekt till grupper (

kluster ). Varje grupp har ett objekt som bäst representerar det; Detta objekt kallas en klusterrepresentant . Tänk på en dataset som består av flera typer av frukter i en korg. Korgen har frukter av olika slag som äpplen, bananer, citroner och päron. I detta fall är frukter dataposter. Dataklypningsprocessen extraherar grupper av liknande frukter ur denna dataset (korg med olika frukter).

Det första steget i en dataklypningsprocess är att översätta denna dataset till en datamatris: Ett sätt att modellera denna dataset är att raderna representerar objekten i datasetet (frukter); och kolumnerna representerar egenskaper eller funktioner som beskriver objekten.

Till exempel kan en fruktfunktion vara frukttypen (som banan eller äpple), vikt, färg eller pris. I det här exempeldatasetet har objekten tre funktioner: frukttyp, färg och vikt.

I de flesta fall tillåter man att

Hämta grupper (kluster) av liknande föremål genom att tillämpa en dataklusteringsteknik på fruktdatasetet enligt ovan.

  • Du kan berätta att din frukt är av N antal grupper. Därefter kan du, om du väljer en slumpmässig frukt, göra ett uttalande om det föremålet som en del av en av N-grupperna. Hämta klusterrepresentanter för varje grupp.

  • I det här exemplet skulle en klusterrepresentant plocka en frukttyp ur korgen och lägga den åt sidan. Egenskapen hos denna frukt är sådan att den frukosten bäst representerar det kluster som det tillhör. När du är klar klustring är din dataset organiserad och uppdelad i naturliga grupperingar.

Datakluster avslöjar strukturen i data genom att extrahera naturliga grupperingar från en dataset. Att upptäcka kluster är därför ett viktigt steg mot att formulera idéer och hypoteser om strukturen i dina data och härleda insikter för att bättre förstå det.

Dataklypning kan också vara ett sätt att modellera data: Den representerar en större mängd data av kluster eller klusterrepresentanter.

Dessutom kan din analys söka helt enkelt att partitionera data till grupper av liknande saker - som när

marknadssegmentering partitionerar målmarknadsdata till grupper som Konsumenter som delar samma intressen (

  • Konsumenter som har gemensamma behov (till exempel dem med specifika matallergier)

  • Identifiera kluster av liknande kunder kan hjälpa dig att utveckla en marknadsföringsstrategi som tillgodoser behoven hos specifika kluster.

Dessutom kan dataklypning också hjälpa dig att identifiera, lära eller förutse naturen hos nya dataposter - särskilt hur nya data kan kopplas till att göra förutsägelser. I

mönsterigenkänning kan analysmönster i data (t.ex. köpmönster i specifika regioner eller åldersgrupper) hjälpa dig att utveckla prediktiv analys - förutse i så fall typen av framtida dataposter som kan passar bra med etablerade mönster. Exempel på fruktkorg använder dataklypning för att skilja mellan olika dataposter. Antag att ditt företag monterar egna fruktkorgar och en ny, okänd frukt introduceras på marknaden. Du vill lära dig eller förutsäga vilket kluster det nya objektet kommer att tillhöra om du lägger till det i fruktkorg.

Eftersom du redan har tillämpat dataklypning på fruktdatasetet har du fyra kluster - vilket gör det enklare att förutsäga vilket kluster (specifik typ av frukt) som är lämplig för det nya objektet. Allt du behöver göra är att jämföra den okända frukten med de andra fyra klusterrepresentanterna och identifiera vilket kluster som är den bästa matchen.

Även om processen kan tyckas uppenbar för en person som arbetar med en liten dataset är det inte så uppenbart i större skala - när man måste klara miljontals objekt utan att undersöka var och en.Komplexiteten blir exponentiell när datasetet är stort, mångsidigt och relativt osammanhängande - varför finns klustringsalgoritmer: Datorer gör den typen av arbete bäst.

Grunderna för dataklyssningar i förklarande analyser - dummies

Redaktörens val

Lägg till bilder i ett LayOut-dokument - dummies

Lägg till bilder i ett LayOut-dokument - dummies

LayOut ger dig verktyg för att skapa försättssidor, rubriker, callouts , och symboler - vad som helst som måste åtfölja synpunkter på din modell. Att sätta in bilder i ditt LayOut-dokument är en enkel affär. Välj bara File, Insert och ta den därifrån. Några fler saker att veta om bilder du lägger in: LayOut kan infoga ...

Lägg till bildtexturer till böjda ytor i SketchUp - dummies

Lägg till bildtexturer till böjda ytor i SketchUp - dummies

Märka hur titeln på det här avsnittet slutar med ytor och inte med ansikten? Det beror på att (som ni vet nu) är enskilda ansikten i SketchUp alltid platta - inga undantag. När du ser en icke-plan yta, består den faktiskt av flera ansikten. Du kan inte se kanterna mellan dem eftersom de har blivit utjämnade. ...

Lägg till nya sketchUp-lager och flytta enheter mellan lager - dummies

Lägg till nya sketchUp-lager och flytta enheter mellan lager - dummies

Lager är en mycket användbar del av SketchUp , och de kan göra ditt liv mycket enklare. Så här kan du lägga till ett nytt lager i Sketchup och hur du kan flytta enheter till olika lager. Lägga till ett nytt lager Följ dessa steg för att lägga till ett lager i din SketchUp-fil: Välj Fönster → Lager. Lagren ...

Redaktörens val

Grunderna för innehållsbaserade prediktiva Analytics-filter - dummies

Grunderna för innehållsbaserade prediktiva Analytics-filter - dummies

Innehållsbaserade predictive analytics recommender-system, mestadels matchningsfunktioner (taggade sökord) bland liknande föremål och användarens profil för att göra rekommendationer. När en användare köper ett objekt som har taggade funktioner, rekommenderas objekt med funktioner som matchar originalets original. Ju fler funktioner matchar desto högre sannolikhet kommer användaren att vilja ...

Grunderna för dataklyssningar i förklarande analyser - dummies

Grunderna för dataklyssningar i förklarande analyser - dummies

En dataset (eller datainsamling) är en uppsättning artiklar i prediktiv analys. Exempelvis är en uppsättning dokument en dataset där dataelementen är dokument. En uppsättning användaruppgifter för sociala nätverk (namn, ålder, lista över vänner, bilder osv.) Är en dataset där dataobjekten är profiler av sociala ...

Stora data- och elverktyg - dummies

Stora data- och elverktyg - dummies

Ett område där stora data har påverkat elverktyg är utvecklingen av smarta mätare. Smarta mätare ger en mer exakt mätning av energianvändningen genom att ge mycket frekventare avläsningar än traditionella mätare. En smart mätare kan ge flera läsningar om dagen, inte bara en gång i månaden eller en gång i kvartalet. ...

Redaktörens val

Vertikala eller horisontella ramar för makrofotografier - dummies

Vertikala eller horisontella ramar för makrofotografier - dummies

Skillnaden mellan ett vertikalt eller horisontellt format i makro och nära -fotografering kan avgöra framgången för dina kompositioner. Att veta vilka som ska användas i en viss situation kan baseras på ett antal faktorer, såsom ämnets höjd och bredd, vilken typ av miljö den är i, vad du vill ...

Med fokuslås på din autofokuskamera - dummies

Med fokuslås på din autofokuskamera - dummies

Autofokuspunkter och fotograferingskameror ger fantastiskt skarpa bilder när du använder dem ordentligt. Men att få skarpa resultat kräver ibland att man ska veta var man ska fokusera. Ett vanligt fokuseringsproblem uppstår när du avsiktligt placerar ett ämne utanför mitten i sökarramen. Säg att du vill komponera skottet av dina vänner och bergen på det här sättet. Du ...

Vad är Macro Photography? - dummies

Vad är Macro Photography? - dummies

Termen makrofotografering har kommit att betyda många saker genom tiden, till exempel mycket närbilder, livstidsrepresentationer av ämnen eller fotografering av förstorade ämnen. I verkligheten betyder makro något mycket specifikt och avser endast en liten procentandel av de ideer som är förknippade med det. Makrospecifika redskap tenderar att vara dyra, så många tillverkare ...