Hem Personliga finanser Så här konverterar du Raw Data till en Predictive Analysis Matrix

Så här konverterar du Raw Data till en Predictive Analysis Matrix

Innehållsförteckning:

Video: Nassim Haramein 2015 - The Connected Universe 2025

Video: Nassim Haramein 2015 - The Connected Universe 2025
Anonim

Innan du kan extrahera grupper av liknande dataobjekt från ditt dataset för ditt prediktiva analysprojekt, kanske du måste representera dina data i en tabell format som kallas en datmatris . Detta är ett förbehandlingssteg som kommer före dataklypning.

Så här skapar du en förutsägbar analysmatris av termer i dokument

Antag datasetet som du ska analysera finns i en uppsättning Microsoft Word-dokument. Det första du behöver göra är att konvertera uppsättningen dokument till en datamatris. Flera kommersiella och open source-verktyg kan hantera den uppgiften, som producerar en matris, där varje rad motsvarar ett dokument i datasetet. Exempel på dessa verktyg är RapidMiner och R text mining paket.

A dokument är i grunden en uppsättning ord. En termen är en uppsättning av ett eller flera ord.

Varje term som ett dokument innehåller nämns antingen en eller flera gånger i samma dokument. Antalet gånger en term nämns i ett dokument kan representeras av termfrekvens (TF), ett numeriskt värde.

Vi konstruerar matrisen av termer i dokumentet enligt följande:

  • De termer som visas i alla dokument finns listade över den övre raden.

  • Dokttitlar listas längst ned till vänster kolumnen

  • Numren som visas i matriscellerna motsvarar varje termins frekvens.

Exempelvis är dokument A representerat som antal siffror (5, 16, 0, 19, 0, 0.) där 5 motsvarar antalet gånger som uttrycket predictive analytics upprepas, 16 motsvarar antalet till gånger datavetenskap upprepas, och så vidare. Det här är det enklaste sättet att konvertera en uppsättning dokument till en matris.

Prediktiv Analytics Datavetenskap Lärande Kluster 2013 Antropologi
Dokument A 5 16 0 < 19 0 0 Dokument B
8 6 2 3 0 0 Dokument C
0 < 5 2 3 3 9 Dokument D 1
9 13 4 6 7 > Dokument E 2 16
16 0 2 13 Dokument F 13 0
19 16 > 4 2 Grunderna i val av prediktivt analysterminal En utmaning för att klustra textdokument är att bestämma hur man väljer de bästa villkoren för att representera alla dokument i samlingen. Hur viktigt en term är i en samling dokument kan beräknas på olika sätt. Om du exempelvis räknar hur många gånger en term upprepas i ett dokument och jämför det totala med hur ofta det återkommer i hela samlingen får du en känsla av begreppets betydelse i förhållande till andra villkor. Baserat på den relativa betydelsen av en term på sin frekvens i en samling är det ofta känt som

viktning

. Den vikt du tilldelar kan baseras på två principer:

Villkor som visas flera gånger i ett dokument gynnas över termer som bara visas en gång.

Villkor som används i relativt få dokument är favoriserade över termer som nämns i alla dokument. Om (till exempel) termen century

  • nämns i alla dokument i datasetet, kanske du inte överväger att ge den tillräckligt med vikt för att ha en kolumn i sig själv i matrisen.

  • På samma sätt kan du enkelt konvertera datasetet till en matris om du arbetar med en dataset för användare av ett online socialt nätverk. Användar-ID eller namn kommer att inneha raderna; kolumnerna kommer att lista funktioner som bäst beskriver dessa användare.

Så här konverterar du Raw Data till en Predictive Analysis Matrix

Redaktörens val

Hur man stöder andra klagomålare - dummies

Hur man stöder andra klagomålare - dummies

Du kan använda din inflytande lista för att göra godkännanden som är en handling Klout beskriver att ge + K. En del av ditt Klout-poäng kommer från antalet anmärkningar du får från andra. Klout lägger en gräns på 10 på antalet anmärkningar som man kan ge varje dag för att behålla ...

Hur man finjusterar dina sociala medier Metrics Goals - dummies

Hur man finjusterar dina sociala medier Metrics Goals - dummies

Du kan använda försäljningstrattdata för att finjustera dina mål för sociala medier. En del av finjustering av dina mål är att hona ner dem tills de övergår från förhoppningar till milstolpar. Här är några exempel på saker som människor misstänker för mål: Vill du tjäna mer pengar. Detta är ett hopp och en dröm och ett bra ...

Hur man får e-postmeddelanden för dina klädprutor - dummies

Hur man får e-postmeddelanden för dina klädprutor - dummies

Om du brukar inte besöka Klout regelbundet, du kan skapa en e-postvarning för Perks. Det kan vara svårt att hålla reda på allt du har pågått i sociala medier världen. Detta kan hjälpa till att förenkla din sociala medierhantering. När du är berättigad till en Perk och ...

Redaktörens val

Hur man identifierar typerna av gruppspel på LSAT-dummiesna

Hur man identifierar typerna av gruppspel på LSAT-dummiesna

En väg till identifiera gruppspel på LSAT är genom att känna igen språket som fakta och regler inte använder. Även om vissa gruppspel kan också inkludera ett beställningselement, är de flesta märkbart beroende av beställningsreferenser, såsom första / sista, högre / lägre och före / efter. I stället innehåller fakta och regler formuleringar som föreslår att man matchar en ...

Hur man svarar frågor om strukturer av argumentet på LSAT-dummiesna

Hur man svarar frågor om strukturer av argumentet på LSAT-dummiesna

LSAT förväntar dig att förstå grunderna för ett bra argument. Individer som argumenterar använder en mängd olika taktik för att göra sina poäng och avväpna sina motståndare. De kan neka någonting som den andra personen säger, utmana motståndarens bevis, förklara vad de menar eller använda analogier för att illustrera sina poäng. Advokater använder dessa taktik ...

Hur man gör argument för antaganden för LSAT-dummiesna

Hur man gör argument för antaganden för LSAT-dummiesna

Gör ett argument utan att man antar minst en eller två punkter är nästan omöjliga. Om du säkerhetskopierar allt du säger kan det ta evigt, och ibland måste du ta på sig något för argumentets skull. Förutsättningar är inte nödvändigtvis dåliga, men du måste känna igen dem när de uppstår. Söka-antaganden frågor fråga ...

Redaktörens val

Med hjälp av Outlook Web App på ditt nätverk - dummies

Med hjälp av Outlook Web App på ditt nätverk - dummies

De flesta som ansluter till sina kontorsnät hemifrån behöver verkligen bara deras email. Om den enda anledningen till att du får tillgång till kontorsnätet är att få e-post, prova det här enkla, enkla verktyget: Outlook Web App, även känt som OWA. Denna Microsoft Exchange Server-funktion kan nå ditt företags e-postmeddelande från vilken dator som helst ...

Med hjälp av nätverkskort (NIC) - dummies

Med hjälp av nätverkskort (NIC) - dummies

Varje dator på ett nätverk, både klienter och servrar, kräver ett nätverkskort (eller NIC) för att komma åt nätverket. En NIC är vanligtvis ett separat adapterkort som glider in i en av serverns moderkorts expansionskort. Men de flesta nyare datorer har NIC inbyggt i moderkortet, så ett separat kort ...

Virtualisering Mini-Glossary - dummies

Virtualisering Mini-Glossary - dummies

För att hjälpa dig att få en bättre förståelse och utöka din kunskap om virtualisering, lära känna dessa användbara termer och hur de gäller virtualisering och dess process: Bare metall: Virtualiserade servrar där virtualiseringsprogrammet installeras direkt på maskinen istället för på ett operativsystem. Eftersom det installeras på maskinen, ...