Hem Personliga finanser Grunderna för dataklyssningar i förklarande analyser - dummies

Grunderna för dataklyssningar i förklarande analyser - dummies

Video: Grunderna för riktigt bra wedgar 2025

Video: Grunderna för riktigt bra wedgar 2025
Anonim

A dataset < (eller datainsamling) är en uppsättning objekt i prediktiv analys. Exempelvis är en uppsättning dokument en dataset där dataelementen är dokument. En uppsättning användaruppgifter för sociala nätverk (namn, ålder, lista över vänner, bilder osv.) Är en dataset där dataelementen är profiler av sociala nätverksanvändare. Dataklypning

är uppgiften att dela en dataset i delmängder av liknande föremål. Objekt kan också hänvisas till som instanser, observationer, enheter eller dataobjekt. I de flesta fall representeras en dataset i tabellformat - en datamatris . En datamatris är en tabell med siffror, dokument eller uttryck som representeras i rader och kolumner enligt följande:

Varje rad motsvarar ett givet objekt i datasetet.
  • Rader kallas ibland som

    objekt, föremål, instanser eller observationer. Varje kolumn representerar en särskild egenskap för ett objekt.

  • Kolumner kallas

    funktioner eller attribut. Användning av dataklypning till en dataset genererar grupper av liknande dataposter. Dessa grupper heter

kluster - samlingar av liknande dataposter.

Liknande

objekt har ett starkt mätbart förhållande bland dem - färska grönsaker, till exempel, liknar varandra än de är frysta livsmedel - och klusteringstekniker använder det förhållandet till gruppen föremålen. Styrkan av ett förhållande mellan två eller flera objekt kan kvantifieras som en

likhetsåtgärd: En matematisk funktion beräknar korrelationen mellan två dataposter. Resultaten av den beräkningen, som heter likhetsvärden, jämför i huvudsak ett visst dataobjekt till alla andra objekt i datasetet. Dessa andra objekt kommer att vara antingen mer eller mindre lika i jämförelse med det specifika objektet.

Beräknade likheter spelar en viktig roll för att tilldela objekt till grupper (

kluster ). Varje grupp har ett objekt som bäst representerar det; Detta objekt kallas en klusterrepresentant . Tänk på en dataset som består av flera typer av frukter i en korg. Korgen har frukter av olika slag som äpplen, bananer, citroner och päron. I detta fall är frukter dataposter. Dataklypningsprocessen extraherar grupper av liknande frukter ur denna dataset (korg med olika frukter).

Det första steget i en dataklypningsprocess är att översätta denna dataset till en datamatris: Ett sätt att modellera denna dataset är att raderna representerar objekten i datasetet (frukter); och kolumnerna representerar egenskaper eller funktioner som beskriver objekten.

Till exempel kan en fruktfunktion vara frukttypen (som banan eller äpple), vikt, färg eller pris. I det här exempeldatasetet har objekten tre funktioner: frukttyp, färg och vikt.

I de flesta fall tillåter man att

Hämta grupper (kluster) av liknande föremål genom att tillämpa en dataklusteringsteknik på fruktdatasetet enligt ovan.

  • Du kan berätta att din frukt är av N antal grupper. Därefter kan du, om du väljer en slumpmässig frukt, göra ett uttalande om det föremålet som en del av en av N-grupperna. Hämta klusterrepresentanter för varje grupp.

  • I det här exemplet skulle en klusterrepresentant plocka en frukttyp ur korgen och lägga den åt sidan. Egenskapen hos denna frukt är sådan att den frukosten bäst representerar det kluster som det tillhör. När du är klar klustring är din dataset organiserad och uppdelad i naturliga grupperingar.

Datakluster avslöjar strukturen i data genom att extrahera naturliga grupperingar från en dataset. Att upptäcka kluster är därför ett viktigt steg mot att formulera idéer och hypoteser om strukturen i dina data och härleda insikter för att bättre förstå det.

Dataklypning kan också vara ett sätt att modellera data: Den representerar en större mängd data av kluster eller klusterrepresentanter.

Dessutom kan din analys söka helt enkelt att partitionera data till grupper av liknande saker - som när

marknadssegmentering partitionerar målmarknadsdata till grupper som Konsumenter som delar samma intressen (

  • Konsumenter som har gemensamma behov (till exempel dem med specifika matallergier)

  • Identifiera kluster av liknande kunder kan hjälpa dig att utveckla en marknadsföringsstrategi som tillgodoser behoven hos specifika kluster.

Dessutom kan dataklypning också hjälpa dig att identifiera, lära eller förutse naturen hos nya dataposter - särskilt hur nya data kan kopplas till att göra förutsägelser. I

mönsterigenkänning kan analysmönster i data (t.ex. köpmönster i specifika regioner eller åldersgrupper) hjälpa dig att utveckla prediktiv analys - förutse i så fall typen av framtida dataposter som kan passar bra med etablerade mönster. Exempel på fruktkorg använder dataklypning för att skilja mellan olika dataposter. Antag att ditt företag monterar egna fruktkorgar och en ny, okänd frukt introduceras på marknaden. Du vill lära dig eller förutsäga vilket kluster det nya objektet kommer att tillhöra om du lägger till det i fruktkorg.

Eftersom du redan har tillämpat dataklypning på fruktdatasetet har du fyra kluster - vilket gör det enklare att förutsäga vilket kluster (specifik typ av frukt) som är lämplig för det nya objektet. Allt du behöver göra är att jämföra den okända frukten med de andra fyra klusterrepresentanterna och identifiera vilket kluster som är den bästa matchen.

Även om processen kan tyckas uppenbar för en person som arbetar med en liten dataset är det inte så uppenbart i större skala - när man måste klara miljontals objekt utan att undersöka var och en.Komplexiteten blir exponentiell när datasetet är stort, mångsidigt och relativt osammanhängande - varför finns klustringsalgoritmer: Datorer gör den typen av arbete bäst.

Grunderna för dataklyssningar i förklarande analyser - dummies

Redaktörens val

Hur man byter ut Excel 2010-data för att se all text - dummies

Hur man byter ut Excel 2010-data för att se all text - dummies

Använd Wrap Text knappen på fliken Hem i Excel 2010 för att lägga in lång text i en cell genom att visa den på flera rader i cellen. Den här funktionen hjälper dig att undvika problemet med att förkorta text eller bredda kolumner för att visa all text som finns i cellerna. När ...

Hur man skriver formulär i Excel 2013 - dummies

Hur man skriver formulär i Excel 2013 - dummies

Excel formler kan göra allt som en grundläggande kalkylator kan göra, så om du har bråttom och inte vill dra upp Windows Calculator-programmet kan du skriva in en formel i Excel för att få ett snabbt resultat. Experimentera med denna typ av formel är ett bra sätt att bli van vid formler i ...

Redaktörens val

Gör och gör inte för golfspectators - dummies

Gör och gör inte för golfspectators - dummies

Golf etikett är inte begränsat till bara spelare. Om du deltar i en golfturnering (professionell eller amatör), var medveten om att fansen förväntas uppträda på vissa sätt så att de inte stör spelarna eller andra åskådare. Du kommer aldrig att gå fel om du följer dessa enkla golfetikettstandarder: Gör: Var tyst när spel är ...

Viktiga artiklar du behöver i din golfväska - Dummies

Viktiga artiklar du behöver i din golfväska - Dummies

Golfväskor är inte bara för att hålla klubbar. Som någon sport behöver golf annan viktig utrustning och hjälpsamma saker som gör ditt spel lite enklare. Här är väsentliga för att sätta på dig din golfbag: Minst sex bollar Ett par trätoppar Ett par handskar En regnbåge Ett repeteringsverktyg för höjdpunkter Ett par ...

Redaktörens val

Hur man startar om webhosthanteringsservicen - dummies

Hur man startar om webhosthanteringsservicen - dummies

Skönheten hos en webbhotell är att alla sina huvudfunktioner har sin egen "service" som du kan starta om. En tjänst är en mjukvara - ett program som körs på servern som hanterar en viss funktion. Om en av tjänsterna slutar fungera, behöver du inte nödvändigtvis starta om ...

Hur man tar bort din webbplats från en svart lista - dummies

Hur man tar bort din webbplats från en svart lista - dummies

Ditt domännamn eller IP-adressdomän är svartlistad när det har visat sig att skicka spam e-post. Om din webbplats har svartlistats kan det inte vara ditt fel - speciellt om du är på en delad server. Det kan hända att en annan webbplats på servern har skickat avsiktligt skräppost. Det är också ...

Hur man hanterar webbhanteraren Mail Queue - dummies

Hur man hanterar webbhanteraren Mail Queue - dummies

Med åtkomst till backend på din server, får du också åtkomst till vissa webbhanterarens mailfunktioner som tidigare inte var tillgängliga för dig. Bläddra i den vänstra menyn i WHM för att hitta avsnittet Mail som ligger nära botten. I det här avsnittet finns det alternativ som kan vara användbara för dig om ...