顯示具有 GoogleML 標籤的文章。 顯示所有文章
顯示具有 GoogleML 標籤的文章。 顯示所有文章

2024年7月7日 星期日

Google開源Gemma2 27B的重點分享

 


大家好,我是Jerry老師,今天又來分享一個最新的Google模型Gemma2 27B,這個是目前地表上離線版最好的模型,同時也可以商用,不過現在語言模型生命週期很短,很期待下一代的模型的開放。

 

Gemma2 ㄧ樣是decoder-only transformer 架構,而Context Length相較前一代提升到8192 tokens,並且採用Rotary Position Embeddings (RoPE)GeGLU,以及更深的網路。

 

其中有幾個重點是與Gemma1的不同包含如下:

·      Local Sliding Window and Global Attention

o   在每一層計算中採用加入Global+sliding window的做法,可以降低運算資源

o   這個技術來自於Longformer,有興趣的讀者可以讀這篇

·      Logit soft-capping

o   基於Gemini 1.5的概念,限制每一個attention layerfinal layer的邏輯數,加快輸出效率

o   同時取消採用傳統Flash Attention的做法

·      Post-norm and pre-norm with RMSNorm

o   這個跟上一代一樣的用法,但是做了一些正規化的動作

·      Grouped-Query Attention

o   這個也是上一代的用法,在論文中指出用這個方法的模型再縮小後,困惑度影響較小。

 

訓練資料的包含如下:

·      27B採用13 trillion Tokens,包含網路資料、論文等

·      9B則採用8 trillion Tokens

·      Tokenizer採用SentencePiece  byte-level encodings

·      同時自動去除個人資料、敏感資料

·      初始化訓練的機器是27B採用6144TPUv59B採用4096TPUv4

o   這部分跟之前Jerry老師分享的差不多,1B的模型差不多要256~512GPU

·      訓練方法採用ZeRO-3,來進行分散式訓練

 

通常做完基礎模型,還會需要進行指定任務的微調,這邊Google也做了以下的工作

·      Supervised fine-tuning (SFT)

o   把準任務給LLM開始做微調

·      Reinforcement Learning from Human Feedback (RLHF)

o   在微調後,透過RLHF提升準確率

·      Model merging

o   合成其他專業的模型超參數

·      Data filtering

o   一樣再度過濾個人資訊、敏感資訊

·      Formatting

o   將輸入與輸出的格式標準化

 

其中有趣的地方是,論文中有提到縮小模型後對於原本模型的影響,譬如說如果困惑度是60(初始化訓練),則縮小後的模型,會提高10%。但如果模型本身訓練的時候採用GQA,反而模型變化就不大,且推論速度可以更快。

 

接下來是大家在意的評測狀況



 

跟預期的一樣,參數較大的模型,還是勝出較小的模型,不過整體分數已經沒有差太多,我們可以從上面表格看到,70B模型在特定題目上,如MMLU只差5分左右。再來我們看到 Gemma2特別跟大陸的Qwen1.5(通義千問)去比較,可以發現分數比他好一些,但不同的是參數大小是Gemma2較小。我們可以看到目前整體來說,有機會模型參數小,分數能維持水準的模型並不多,而Gemma 2是其中一個。

 



 

從透過Chatbot Arena 的方式,進入Elo rating system評分後,唯一通過競賽的落地模型,只剩下Yi系列 Gemma系列,相當期待後續Gemma進入到70B之後的表現。

 

 

不過Gemma2的原生版本建議執行在TPUH100以後的機器,所以各家企業的GPU要提高到另一個層次才行了,還好有Colab,可以先看看有沒有機會抽到比較好的顯卡,至少要準備70GBVRAM

 

 

請到這裡享用程式碼 

論文中還有很多值得閱讀的內容,也留給大家品味一下

2023年9月9日 星期六

Google I/O Connect 2023 速記


 

會場入口,本次活動每日有超過2,000個開發者參加


 大家好,我是Jerry老師,今年很榮幸能夠以Google機器學習開發專家(GDE)身份參加Google I/O Connect 中國舉辦在上海的活動

 

https://www.ithome.com/0/709/891.htm


活動陣容也相當的大 

 

滿滿中國風


 


這次的乾貨也相當的多,Jerry老師就分享一些跟AI比較相關的議題

首先是讓我印象深刻的DuetAI 的其中一項展示,可以透過Looker ML技術,把資料結合BigQuery把資料撈起來,再透過PaLM把答案做萃取,接著透過ML做一下迴歸預測,把結果輸出後,再自動產生簡報,以前要花好多時間做的事,現在完全一氣呵成。


展示影片:https://www.youtube.com/watch?v=bUHP-XzHUFE

 





 

再來是生成式AI可能為組織帶來的風險



前三名包含敏感資料會洩漏(69%)、錯誤與幻覺(52%)、偏見(50%)等。所以在實務上面模型的使用,更需要專業團隊 或是 工具 來去降低這些風險。

 


 

當然免不了Vertex AI 還是今年主打的工具之一,各種AIPaaS服務支援,都可以在Google Cloud上找到




 

再來是生成式AI的應用場景



 


 

 LLMs的議題大家都在討論,而這張圖滿能夠去解釋,整個趨勢的變化



從過去規則判斷,到AI閱讀大量資料,可以理解並表達資訊,整個AI技術從分類、理解、預測、生成這幾個面向快速的發展。

 

 




但事實上生成式模型已經大量成長在市場上



從數據上來看有超過50%企業沒有AI的團隊可以協助落地

但有超過80%的高階主管認為 AI技術有助於所有業務決策

而從模型投入到生產事實上有非常多挑戰

 

 



包含從模型訓練  模型推論,而一個好用的工具或平台就變得重要。

 


目前Google Cloud支援開源部署的機器,包含最新的TPUv5  A3(NVIDIA H100)

重點是都支援了GKEGCE


有了GKE 我們更需要強化GPU的利用與調配


根據統計平均GPU使用率在25%左右





所以在GKE上面用一塊A100 GPU以切片的方式來使用,GKE的群集上

最多可以支援15,000個節點。

 




也因為基礎設施跟AI有密切關連,所以Google提出了LLMOps的概念


這張圖試圖將模型訓練、模型服務、模型管理、模型治理都連貫一起


Jerry老師跟覺得LLMOps這是一個新工作,同時要具備底層、模型能力,相當的不容易

所以這張分工圖就顯得重要



從使用場景來看

如果我們希望AIGoogle做託管,我們選Vertex AI

如果希望自己多一點關心底層,我們可以選GKE+Vertex

如果AI要自己來,多點DIY,我們可以選GKE

 

 


而且Google針對產品面,做了全面AI導入,包含Workspace, Google Cloud

AI技術未來將會從預測走到生成

 





而這些技術 都能夠在VertexAI上獲得到。

 

這次活動免不了要更新一下PaLM2的發展,最大不同於PaLM2新版,提供了32K的輸入上下文,跟GPT-4一樣的輸入量,再來也有支持多輪對話、程式碼生成等。



 

 

另外就是 Google最強大的BigQuery功能,也與MLGenAI做了許多結合,像是BQML(BigQuery ML),結合Google ML技術,譬如說對大量資料進行迴歸等。




 


同時可以透過 Cloud AI MaaS來實現對PaLM模型的使用



 

最重要的是面對多樣的資料型態,可以透過BQML將結構化與非結構化做資料整合,用於機器學習預測。

透過wide-and-deep來進行推薦系統


https://cloud.google.com/vertex-ai/docs/tabular-data/tabular-workflows/wide-and-deep-train




 

或是透過Vertex LLM做客戶分群、戰略分析



 

做房源的點擊率

 



 


 

透過影像辨識貼標

 



 

 


 

透過GenAI重新生成新行銷圖片



 

裡面乾貨也包含這個




 整個多GPU運行AI環境的建構,以及搭配GKE的範例

https://github.com/googleCloudPlatform/stable-diffusion-on-gcp

 

近期流行的向量資料庫,也有些乾貨可以參考,包含生態



 

Google也有推出類似的服務,像是VME




 

同時也有分享關於Langchain的問答架構

 



 

甚至是IoT整合LLMs場景



 


 

遊戲的GenAI整合



 

新工具

https://github.com/google/visualblocks

 



 

喜歡直接用模型的可參考MediaPipe Studio

https://developers.google.com/mediapipe/solutions/studio

 

 

JAX to JS ,我們知道TF.JS是全球在JS針對AI的部分下載量是最多的套件,而很高興JAX開始支援JS,這將讓我們從應用端到研發端能夠做更好的連結。




 

我們都知道XLAGoogle推出的一個加速模型很重要的編譯器,而Google本次發表了OpenXLA ,看起來是想要在XLA找到社群的平衡。



 

 


 

完全認同做AI的挑戰相當多,所以我更需要有更好更快的方式來實現AI模型的互動



 

歡迎初學者可參考

https://keras.io/keras_core/

NLP有興趣可參考

https://keras.io/keras_nlp/

CV有興趣可參考

https://keras.io/keras_cv/

 

Keras未來將完全支援TensorFlow, JAX, and PyTorch,使用者不需要再煩惱要用哪一個框架。使用mediapipe的朋友如果想訓練客製化模型,也可以直接學Keras,然後再搭配mediapipe去做應用,如果想挑戰深度的客製化模型,會建議採用TensorFlowJAX,或是Pytorch 。但總而言之Keras未來將會完全深度整合這些知名框架,所有的開發者請安心使用。



歡聚時光中,我們跟許多Google大大們以及社群朋友做了許多交流,收穫很多。

這個活動參與包含GDGWTMGDE,感謝Google,如果您也是Google的開發者,或是正在成為開發者的路上,歡迎加入我們大家庭。

 

GDG Taipei:

https://gdg.tw/

 

WTM Taiwan

https://wtm.tw/

 

GDE

https://developers.google.com/community/experts

 

這是一個臥虎藏龍的技術社群,Jerry老師在這裡認識了來自Intelhuggingface、微軟等技術高手,歡迎大家一起來交流學習與成長。