顯示具有 資料科學團隊 標籤的文章。 顯示所有文章
顯示具有 資料科學團隊 標籤的文章。 顯示所有文章

2019年9月9日 星期一

[ML Study Jam] How Google does Machine Learning的Module 3 Quiz學習日誌之企業導入機器學習的方法

How Google does Machine Learning的學習日誌

最近Google連續辦了兩次ML Study Jam的活動,包含
ML Study Jam 機器學習培訓計劃- 初級- 首頁,以及ML Study Jam 機器學習培訓計劃- 進階-首頁,這兩階段的課程內容,個人覺得非常適合企業在導入ML給同仁必上的內容,尤其適合非科班出身的又想轉型的朋友們。

在進階課程的當中,筆者覺得在「How Google does Machine Learning」當中,有許多有趣的題目與內容,是自己多年做資料科學服務有所共鳴的,希望能夠透過部落格分享學習的心得,提供給想導入ML的企業與想持續學習導入ML的朋友。(請注意本篇文章僅針對部分題目提供心得分享,並非答案分享)


過去筆者在導入多年的資料科學服務當中,發現資料科學家要有一個非常重要的能力,是能夠快速辨識這家企業與題目,到哪一個階段,接著再給予對應的服務內容,避免導入過程資源的浪費,而課程當中Google整理了一個「Path to ML」來幫忙大家釐清企業的ML導入階段。

在Module 3 Quiz的部分,有一題要學員能夠針對題目,以「Path to ML」五階段做辨認,而其中五階段包含「Individual contributor」、「Delegation」、「Digitization」、「Big data and Analytics」、「Machine learning」,在ML and Business Processes課程當中,個人覺得非常好的一個觀念是,企業要導入一個從無ML->有ML的過程,必須先找到流程上的輸入與輸出,接著在輸出中透過數據與ML找出具有洞見的結果,將結果回到流程上去改善輸出。

因此回到「Path to ML」,我們首先要能夠辨認,我們在企業流程中,到底是哪一個階段,才能去藉由階段工作來正確導入ML,筆者整理如下:

I for individual contributor:任務的本體,如單一櫃員
D for delegation:多個可執行任務的人,如多個店員
Z for digitization:數位化的工具,如ATM,可以透過機器進行重複化的工作
B for big data and analytics:透過資料挖掘洞見,提升營運效率,如汽車生產
M for machine learning:透過前面的數據,以機器學習來自動化改善整個營運效益,如推薦系統

聰明的朋友,如果題目如下,您會將上述的I,D,Z,B,M,分別放在哪裡呢?

問題1
製造工廠有許多機械手臂,整個生產團隊透過手臂上收集的數據來幫助確定生產的時間表。
問題2
一個客戶服務團隊持續接收在線上的訂單
問題3
一個圖書館員在城市圖書館工作
問題4
停車收費系統根據可能預期的需求來自動改變費率
問題5
自動電子收費器透過讀取汽車牌照跟駕駛索取過路費(如ETC)

問題1看起來非常明顯是以數據來挖掘洞見,問題2與問題3很容易理解是傳統的運作階段,問題4與問題5比較容易會有誤會是在「digitization」與「machine learning」的差別,但仔細一看,事實上ML有個關鍵是透過數據「自動化」原先的流程,因此會獲得一個不斷改變的輸出,答案就出來了。


看起來大家都有十足的把握了,我們繼續看一下去,如果題目如下,您們的選擇為何?

題目6
所有任務,包含執行參數、選擇參數、參數回饋都是自動化
題目7
一個人在執行任務,而這個任務與指令來自人與人之間的方式運作
題目8
一個電腦執行任務,而軟體工程師透過歷史的模式,來進行參數的調整。
題目9
一個電腦執行過程是透個人從介面上輸入參數來進行。
題目10
一個任務是從一群人來完成

問題6我們可以發現全數自動化,會是機器學習的強項,答案是非常明確的。接著在問題7與問題10的部分,也很容易辨識是傳統1個與多個人的運作方式,最後這次的題目8與題目9分別就相對明顯很多,題目9單純只有透過介面來做互動,而題目8則透過數據挖掘模式來進行參數調整。


最後在Quiz最尾端的題目也非常有趣,題目大意是在說一家企業需要在一年內導入ML,我們是這家企業的顧問,而我們應該請該企業集中資源在哪一個地方,譬如說:「定義關鍵目標」、「收集資料」、「建立基礎設施」、「最佳化演算法」、「整合模型」。

其實有經驗的顧問會選擇「收集資料」,因為這是所有企業導入ML的最重要的問題,尤其以筆者過去的經驗是,傳統企業常常是因為沒有資料而無法導入ML。而其他都不重要嗎?並不是,而是沒有資料,對於定好目標、建立設施、最佳化算法、整合模型就都沒有了意義。

但是筆者提一個觀點是,如果我們企業要導入ML,也不能盲目的收集資料,而是要了解解決什麼問題。
所以回過頭來,一樣可以觀察公司目前的階段,從沒有ML->有ML,我們在「Individual contributor」、「Delegation」、「Digitization」、「Big data and Analytics」、「Machine learning」是哪一個階段,才能將資源妥善運用在導入ML的正確方向當中。

以上是筆者對於「How Google does Machine Learning」的Module 3 Quiz拙見,歡迎討論。

2016年7月17日 星期日

「2016 台灣資料科學愛好者年會」精彩資料總整理(持續更新中)




這幾天(2016/7/14 ~ 2016/7/17)資料科學界在台灣最重要的活動,莫過於2016 台灣資料科學愛好者年會,這已經是每年在台灣資料科學界最大的活動之一,今年的票也是不到一小時就幾乎賣光,對這個活動的歷史有興趣的朋友們可以參考「2015年」、「2014年」,今年的主題相較去年,更有趣,更多元、更多產業上的案例。

除此之外,筆者也發現贊助的公司也變得相當的多,今年贊助公司包含國泰人壽、東森信息科技股份有限公司、玉山金控、funP 雲沛創新集團、HTC、台灣 IBM、新加坡商鈦坦科技 TITANSOFT、潮網科技、Vpon 威朋、宇匯知識、勤業眾信、遊戲橘子、GMobi通用移動、Google、艾肯娛樂、宣捷生物科技、MIGO 功典、Mozilla TW、天氣風險、琅茶,從中我們可以發現不只資訊公司,也包含其他產業的公司,像是生物研究、天氣、會計,甚至是金融業都來加入,整體上台灣資料科學發展的凝聚力,在今年又更上一層樓。


今年筆者一樣秉持著自己也是資料科學愛好的一份子,將今年的資料科學活動內容整理如下,供自己與有興趣的朋友們參考:


  1. 2016台灣資料科學年會開場投影片
  2. Riot Games Head of Data Science
  3. 用數據解決都會城市的停車問題
  4. 隨機對照實驗在公共領域的應用
  5. 數據分析在運輸管理之應用
  6. 大數據下的情緒分析
  7. 一個賭徒的告白 2:交易策略建構與分析,為何你該賭小一點?
  8. 從薪酬制度讀 CEO 的行為心理學 
  9. 自己的空氣品質自己量 : 談參與式環境感測的機會與挑戰
  10. 如何備料:資料的抓取、清理以及串接
  11. 黃從仁/心理與行為資料中的因與果
  12. 資料科學與防疫應用的結合 : 以登革熱防治為例
  13. 資料分析前的奏曲 : 談資料收集的挑戰
  14. How to approach data science problems from start to end
  15. 未來城市的任意門 (Mobility on Demand for Future Cities)
  16. 人類行為訊號處理 : 跨學科 (醫療、教育、心理) 應用實例分享、心得、展望
  17. 從手機解讀行為與心理
  18. Crowd Computing for Big and Deep AI
  19. 智慧型工程管考系統 : 資料分析經驗談
  20. 音樂資料檢索
  21. 當語音處理遇上深度學習
  22. 公私協力的公共服務 - 以資料面詮釋
  23. 從電腦視覺看人工智慧 : 下一件大事
  24. 我在智慧交通資料解析的失敗歷程
  25. It's Not What You Say: It's How You Say It!
  26. 貓都學得會的手機維修資料分析
  27. The Growth of a Data Scientist
  28. Practical Issues in Machine Learning
  29. 沒有大數據怎麼辦 ? 會計師事務所的小數據科學
  30. Feature Engineering in Machine Learning
  31. 漫談 R 的學習挑戰與 R 語言翻轉教室
  32. 娛樂產業中的資料科學家 : 談資料科學於線上遊戲與職業運動之應用
  33. 空間數據分析推動精準新農業
  34. 世代之爭爭什麼 ? 談談如何從調查資料挖掘出豐厚的意義
  35. 資料視覺化的 20 個小訣竅
相關新聞:
其他相關資訊:

2015年9月23日 星期三

60本免費的資料科學書籍



資料科學(Data Science)這個名詞是近幾年非常流行的概念,它其實講的是跨領域(Interdisciplinary)的組成,這些學科包含如下:
  1. 數學 (Mathematics)
  2. 統計 (Statistics)
  3. 化學計量學 (Chemometrics)
  4. 資訊科學 (Information Science)
  5. 電腦科學 (Computer Science)
  6. 機率學 (Probability Theory)
  7. 機器學習 (Machine Learning)
  8. 統計學習 (Statistical Learning)
  9. 資料探勘 (Data Mining)
  10. 資料庫 (Database)
  11. 資料工程 (Data Engineering)
  12. 模式識別 (Pattern Recognition)
  13. 視覺化 (Visualization)
  14. 預測分析 (Predictive Analytics)
  15. 不確定性建模 (Uncertainty Modeling)
  16. 資料倉儲 (Data Warehousing)
  17. 資料壓縮 (Data Compression)、
  18. 電腦程式 (Computer Programming)
  19. 人工智慧 (Artificial Intelligence)、
  20. 高效能運算 (High Performance Computing)
資料科學領域知識包羅萬象,其中更包含特定領域知識的資料挖掘手法,因此資料科學在多個複雜學科中應運而生,既然是資料科學實驗室,就不能不推薦國外的資料科學相關書籍,以下為國外收集的免費資料科學相關書籍,不完全是新書,但希望可以協助讀者能更深入的了解這塊領域,其中幾個學科是必須知道的,像是R、Python這兩個資料科學主流語言,以及人工智慧、機器學習、資料探勘、資料庫等理論與工具書,都是進入資料科學領域的必學知識。


關於資料科學

關於大數據


關於資料分析


關於資料科學團隊


關於分散式分析

關於Python


關於R

關於SQL

關於資料探勘與機器學習


關於統計與統計學習


關於資料視覺化


關於資料科學工具

參考資料: