書海Apsû
海圖 領航員 航海指南
登記成為航海者

書海 ApsûVoyage of a Thousand Books

選擇語言 · Choose your language

書海海圖

拖曳或縮放海圖,點一座島就能上岸

← 回到海圖

← 回到島上 · 格陵蘭
格陵蘭雪橇犬
讀完書摘並留下漂流瓶,即可獲得格陵蘭雪橇犬
登記後就能收集這隻生物
商業資料科學(暫譯)
原文書名:Data Science for Business
作者:佛斯特・普洛沃斯特 (Foster Provost)、湯姆・佛西特 (Tom Fawcett) ⓘ
商業資料科學(暫譯)

0:00
    更好的資料加上更好的資料科學家,等於更好的模型、更好的決策,以及可以持續的競爭優勢。
    閱讀進度 80%
    ▶ 懶得看文字的人,這裡有說書影片:)
    ▶ 敬請期待說書影片
    前往格陵蘭

    適合誰看?

    • 要和資料科學團隊合作的主管、產品經理與行銷人員
    • 商學院學生,想理解資料科學能為企業做什麼
    • 剛入門的資料分析師,想建立紮實的觀念架構
    • 想知道「模型好不好」該怎麼判斷的人

    作者是何許人也?

    • 佛斯特・普洛沃斯特 (Foster Provost),紐約大學商學院教授,長期研究資料科學與機器學習的商業應用
    • 湯姆・佛西特 (Tom Fawcett),資深資料科學家,在業界與研究界都有豐富經驗
    • 英文原名 Data Science for Business: What You Need to Know about Data Mining and Data-Analytic Thinking,2013 年出版,被許多商學院採用為教科書

    本書架構

    🔒 抵達格陵蘭拜訪格陵蘭雪橇犬後,就能看完整內容

    前往格陵蘭
    資料分析思維

    本書的核心概念是「資料分析思維」:用資料的角度看待商業問題,有系統地拆解問題,而不是只憑直覺。作者認為,在現代經濟中,資料是一種策略資產,懂得善用它的公司,就能建立競爭優勢。

    這本書不是寫給工程師看的程式手冊,而是要讓主管和商業人士理解資料科學的基本原理。作者強調,經理人不需要會寫程式,但必須懂得這些原則,才能和技術團隊有效合作、提出對的問題。

    它要培養的,是一種提問與判斷的能力。

    颶風來襲前的草莓派

    書中一開始就舉了一個著名的例子。2004 年颶風法蘭西絲來襲前,沃爾瑪分析過去颶風期間的銷售數據,發現了意想不到的模式:除了手電筒之外,草莓口味的吐司塔銷量大約會暴增到平常的七倍。

    這種發現沒有明顯的因果解釋,卻能可靠地預測需求,讓沃爾瑪提前把正確的商品送到正確的店。作者用這個例子說明,資料探勘能找出人想不到、卻真實存在的消費行為模式。

    席格內銀行的故事:把虧損當成買資料

    書中另一個深具啟發的例子,是 1990 年代美國席格內銀行(Signet Bank)在信用卡業務上的轉型。銀行發現,一小群客戶貢獻了超過百分之百的利潤,其他客戶不是打平就是虧錢。

    於是銀行刻意對不同客戶隨機提供不同的條件,接受短期的虧損,把它當成「取得資料的成本」。幾年下來,這些實驗累積的資料讓銀行建立了預測模型,能針對不同客戶提供量身訂做的方案,獲利大幅提升。這說明資料本身就是值得投資的資產。

    九種資料探勘任務

    作者把各式各樣的資料問題,歸納成幾種基本任務:分類、迴歸、相似度比對、分群、共同出現的分組(例如購物籃分析)、輪廓描述、連結預測、資料縮減,以及因果模型。

    他們認為,把一個商業問題正確地轉化成其中一種資料科學問題,往往比演算法本身更重要。正如書中所說,分析師富有創意的問題設定,常常就是成功的一半。

    問對問題,才能找對方法。

    MegaTelCo:誰會流失

    全書反覆使用一個虛構的電信公司 MegaTelCo 作為案例:在所有客戶中,哪些人可能在合約到期後離開?公司應該對誰提供挽留方案?

    這個例子貫穿了許多章節,讓讀者看到同一個商業問題,如何一步步被定義成分類問題、選擇特徵、建立模型、評估效果,最後轉化成實際的行銷決策。

    作者也提醒,要及早讓開發團隊參與,而不是把資料科學當成和實際上線無關的另一件事;並要用心設計特徵,而不是天真地把所有能拿到的變數都丟進模型裡。

    CRISP-DM:資料探勘的流程

    書中介紹業界常用的資料探勘標準流程(CRISP-DM),分成六個階段:理解商業問題、理解資料、準備資料、建立模型、評估模型,以及部署上線。

    作者強調,這個流程是反覆循環的,而不是一條直線。評估之後常常需要回到前面,重新理解問題或重新準備資料。結構化的流程能降低探索性工作中的不確定性。

    監督式與非監督式學習

    作者提醒,分析一開始就要決定問題屬於哪一種:如果有明確想要預測的目標,例如客戶會不會流失,就是「監督式」學習;如果沒有預設答案,而是想從資料中找出模式,例如替客戶分群,就是「非監督式」學習。

    這個選擇會決定能用哪些技術,以及需要投入多少資源去標記資料。書中也介紹相似度、最近鄰居法和分群等非監督式方法。

    決策樹與資訊增益

    在建立預測模型時,作者用決策樹來說明基本原理。關鍵的概念是「資訊增益」:衡量某個屬性能讓我們對目標的不確定性減少多少,藉此有系統地挑選最有用的屬性。

    作者也說明,從簡單的相關性出發,可以逐步建立更複雜的模型,但必須記得相關不等於因果。商業資料科學常常著重於準確的預測,不一定需要解釋背後的機制,這和重視因果推論的計量經濟學不同。

    過度擬合:最普遍的威脅

    作者把「過度擬合」視為所有資料科學工作中最普遍的威脅。一個把訓練資料配得完美無缺的模型,往往只是記住了雜訊,而不是學到能套用在新資料上的規律。

    解決的方法包括:保留一部分資料不拿來訓練,用來檢驗模型;交叉驗證;以及控制模型的複雜度,例如修剪決策樹或使用正則化。書中也提醒「資料洩漏」的陷阱:模型用到了在實際做決策時根本拿不到的變數。

    期望值框架:什麼才是好模型

    全書最實用的工具之一,是「期望值框架」。作者認為,只看準確率是不夠的:一個準確率百分之九十九的詐欺偵測系統,如果誤報太多、讓員工忙不過來,在經濟上可能還是失敗的。

    期望值框架要求把正確判斷、錯誤判斷的成本和效益都算進來,計算每個決策的預期獲利。什麼是好模型,完全取決於商業脈絡。書中也介紹 ROC 曲線、獲利曲線和提升圖,讓不懂技術的決策者也能看懂模型的表現。

    文字探勘與更多技術

    書中也示範如何把非結構化的文字轉換成可分析的資料,例如「詞袋」、詞頻加權等方法,應用在像是用新聞預測股價變動這類問題上。

    作者也介紹推薦系統、時間序列、因果推論與異常偵測等其他技術,提醒資料科學家要熟悉多種方法,而不是只會一種。

    資料是策略資產

    最後,作者把資料科學提升到公司策略的層次。他們舉例,零售商能從購買模式預測顧客是否懷孕,取得行銷上的優勢;社群網站的估值,也反映了它獨特的網路資料。

    作者主張,資料科學要成功,需要經理人理解基本原理、商業和技術團隊跨部門合作、長期投資資料資產,並重視隱私等倫理問題。資料科學不是一個孤立的技術部門,而是需要人才、流程和資料品質共同支撐的策略能力。

    Shang的觀點

    敬請期待

    其他書摘連結

    • Data Science for Business Summary(Bookey)
    • Notes on Data Science for Business(daaronr)
    • Data Science for Business(Ben Munoz)
    封面為原創示意設計,非出版社原版封面

    留下漂流瓶

    留下你的看法吧!有機會認識跟你想法相同的航海者喔!

    我想把這本書推薦給另一位航海者
    我的推薦指數 拖曳選擇 0.0 – 5.0 分
    4.0
    前往格陵蘭拜訪格陵蘭雪橇犬

    登記成為航海者,才能打開漂流瓶。

    0 個漂流瓶

    ▇▇▇▇▇ ▇▇▇ ▇▇▇▇▇▇▇

    ▇▇▇▇ ▇▇▇▇▇▇ ▇▇▇

    Shang

    Shang

    Shang 的書單

    航海指南

    這個世界

    書海有 16 座真實的島嶼,每座島代表一個主題。島上的每個建築,都是一本書。

    現在可以做什麼

    • 在海圖上點一座島上岸
    • 點島上的建築,閱讀那本書的筆記
    • 到領航員那裡認識 Shang

    即將開放

    • 第二章:登記成為航海者、駕船航行、收集建築徽章、丟漂流瓶
    • 第三章:貝殼、港口市集、驅散迷霧、排行榜
    • 第四章:和其他航海者私下聊天

    圖示說明

    切換語言

    領航員登記處

    出航之前,我們要幫你登記船籍

    航海日誌

    信箱

    排行榜

    航海日誌

    審核漂流瓶

    Shang

    書海 Apsû

    回海圖
    APSÛ // COMM●