I metodi statistici sono una parte fondamentale della scienza dei dati, ma pochi data scientist hanno una formazione statistica formale. Corsi e libri sulle statistiche di base raramente trattano l'argomento dal punto di vista della scienza dei dati. La seconda edizione di questa popolare guida aggiunge esempi completi in Python, fornisce indicazioni pratiche sull'applicazione di metodi statistici alla data science, ti dice come evitarne l'uso improprio e ti dà consigli su ciò che è importante e ciò che non lo è.
Molte risorse di data science incorporano metodi statistici ma mancano di una prospettiva statistica più approfondita. Se hai familiarità con i linguaggi di programmazione R o Python e hai una certa conoscenza della statistica, questo riferimento rapido colma il divario in un formato accessibile e leggibile.
Con questo libro, imparerai:
Perché l’analisi esplorativa dei dati è un passaggio preliminare fondamentale nella scienza dei dati
Come il campionamento casuale può ridurre le distorsioni e produrre un set di dati di qualità superiore, anche con big data
Come i principi del disegno sperimentale forniscono risposte definitive alle domande
Come utilizzare la regressione per stimare i risultati e rilevare anomalie
Tecniche di classificazione chiave per prevedere a quali categorie appartiene un record
Metodi statistici di machine learning che "imparano" dai dati
Metodi di apprendimento non supervisionato per estrarre significato da dati non etichettati
Circa l'autore
Peter Bruce è il Fondatore e Chief Academic Officer dell'Institute for Statistics Education presso Statistics.com, che offre circa 80 corsi in statistica e analisi, circa la metà dei quali sono rivolti ai data scientist.. È autore o coautore di diversi libri in statistica e analisi, e ha conseguito la laurea triennale a Princeton e le lauree magistrali ad Harvard e all'Università del Maryland.
^
Andrew Bruce, Principal Research Scientist presso Amazon, ha oltre 30 anni di esperienza in statistica e data science in ambito accademico, governativo e aziendale.. Coautore di Applied Wavelet Analysis with S-PLUS, ha conseguito la laurea triennale a Princeton e il dottorato in statistica presso l'Università di Washington.
^
Peter Gedeck, Senior Data Scientist presso Collaborative Drug Discovery, è specializzato nello sviluppo di algoritmi di machine learning per prevedere le proprietà biologiche e fisico-chimiche dei candidati farmaci.. Co-autore di Data Mining for Business Analytics, ha conseguito il dottorato in Chimica presso l'Università di Erlangen-Nürnberg in Germania e in Matematica presso la Fernuniversität Hagen, Germania.