
機器學習名聲在外但真要說清楚它是什么卻難倒了不少數據科學從業者。本文提供三套解釋方案從專業到通俗任君選用。版本一專業“勸退”型機器學習是一門交叉學科涉及概率論、統計學、逼近論等多領域。它研究計算機如何模擬人類學習行為——利用已有數據歸納出模型再用模型預測未來。它不靠演繹推導而是基于歸納與綜合是人工智能實現智能的根本途徑。應用覆蓋數據挖掘、計算機視覺、NLP、醫學診斷、證券分析、戰略游戲等眾多領域。這個版本的特點是每句話都對但聽完基本等于沒聽。版本二以小見大型想象一個漆黑的房間里漂浮著無數小球你想知道它們的位置是否有規律——比如是否集中在某些區域。你帶著閃光燈從不同角度拍照正面拍、側面拍、高處拍都看不出名堂。最后從低角度拍終于發現小球集中在屋頂和地面附近中間是空的。這就是“找到好角度”的價值。現實中醫院病人的病歷可能有500個維度的數據——年齡、體重、血壓、膽固醇等。人眼不可能看到500維空間的結構就像黑屋里看不見小球。只有通過算法從“合適角度”降維“拍照”才能發現心臟病患者是否聚集、新病人有無類似風險。所謂大數據洞察就是找到那個正確的“角度”。版本三買芒果的故事你第一次買芒果奶奶說“嫩黃的甜”你照做回家發現有的不甜。后來你總結出大個嫩黃一定甜小個嫩黃只有一半甜。下次去換了個攤位產地不同規則全廢——原來小個暗黃才最甜。這就是手動寫規則的困境環境一變就得重來。你開始寫程序把顏色、大小、產地、軟硬都設成規則但規則越來越多永遠跟不上變化。機器學習換了個思路你挑一批芒果記錄所有屬性顏色、大小、產地、軟硬度和結果甜不甜、多汁不扔給算法。算法自動學習出一個模型下次輸入新芒果的屬性就能預測它甜不甜、多汁不。更重要的是——隨著數據增加模型會自我修正、越來越準。換個水果同一套算法喂蘋果數據就學蘋果喂香蕉數據就學香蕉。這就是機器學習不用你寫規則讓數據自己說話。