跳到主要內容

發表文章

目前顯示的是有「CHATGPT」標籤的文章

大型語言模型(LLM)的轉折點

2024年可以好好思考這件事 這個圖蠻有趣,厚積薄發,不...是爆發,它也帶出來了投資(人生、職場、事業...)的某些哲理跟脈絡,這圖是在說,大型語言模型(像chatGPT / bard 這類語言模型) ,訓練多少資料時,他的準確率變化,圖的下方軸線是餵入的資料數,左邊是預訓練後的正確率 從圖上可以看到,在餵入幾十億~百億筆資料之前,做預訓練模型時,它的準確率跟直接隨機亂猜想答案的結果幾乎一樣,所以在那之前的投資者、或是開發者一定在想,我們都已投人大量資金餵入上千萬,甚至幾億筆那麼多的資料了,還是無效,所以,這些模型都是廢物,不值得投資,在當下沒人知道是不是再餵入更多資料(再多投入一點資金),模型會有顯著的變化,所以,在那個轉折點前就放棄了,於是他們的的投資,不管是錢還是技術,就真的化為灰燼,然而,後進者反而只是多投了一點資金,或是那些賭性堅強只是再多補一點錢進來,這個產業從此爆發了⋯ 所以,你在轉折點前,其實是看不出一個(投資)事業的勢,很多時候就是傻,這也跟我的經驗若干符節,而當事業的動能跑出來後,我們才知道誰是對的,在這裡面,沒有先知、沒有事前的洞見、沒有高瞻遠矚的風險思維,只有事後諸葛的半仙會說,早知道加入這個投資、早知道多拿點錢,早知道、搞不好現在是首富了🤨🤔️😐

變形金剛

  #變形金剛 近期的 #LLM 模型是因為前幾年 #RNN 模型不容易被平行化,他的序列必須LOOP 好幾次才能得到結果,以至於計算的維度大爆炸,而變形金剛( #Transformer )裡的注意力機制網路層( #self_attention ) 主要是改善這個問題,有點像是把 RNN 轉用CNN 實踐 ,然而 #CNN 很容易忘記前面的資訊,於是他要使用好幾層,而CNN 的好處是比較容易做平行運算,能夠獨立平行運算的計算,就容易放進單獨的 #GPU 單元去做運算 把循序的程序拆解,讓可以平行的平行,不能的想辦法合併,這個概念不止在生成式ai 如此,在專案管理,製程改善…其實都是同樣的道理