階】學(xué)習(xí)率(Learning Rate)調(diào)參玄學(xué):大了不收斂,小了動(dòng)不了)
【AI大模型進(jìn)階】學(xué)習(xí)率(Learning Rate)調(diào)參玄學(xué):大了不收斂,小了動(dòng)不了這是【AI大模型進(jìn)階】系列第七十三課,是繼 Batch Size 之后,模型訓(xùn)練最核心、最關(guān)鍵、最能決定成敗的第二大超參數(shù)必修課。上一節(jié)課我們徹底搞懂了 Batch Size(批次大小),明白了如何壓榨GPU算力、平衡訓(xùn)練速度與模型泛化能力。很多同學(xué)實(shí)操后會(huì)發(fā)現(xiàn)一個(gè)詭異問題:明明Batch大小調(diào)得沒問題、模型結(jié)構(gòu)沒錯(cuò)、數(shù)據(jù)沒問題,可模型就是訓(xùn)不動(dòng)、收斂極慢、Loss來(lái)回震蕩,甚至越訓(xùn)越差。99%的這類訓(xùn)練翻車問題,根源只有一個(gè)——學(xué)習(xí)率(Learning Rate,LR)設(shè)置不當(dāng)。在深度學(xué)習(xí)和大模型微調(diào)領(lǐng)域,學(xué)習(xí)率一直被新手稱為“調(diào)參玄學(xué)”:調(diào)大一點(diǎn)直接震蕩不收斂、Loss爆炸;調(diào)小一點(diǎn)模型徹底僵死、幾千輪訓(xùn)練毫無(wú)變化。很多人訓(xùn)練模型全靠蒙參數(shù)、反復(fù)試錯(cuò),浪費(fèi)大量算力和時(shí)間。本節(jié)課徹底破除學(xué)習(xí)率的玄學(xué)面紗,不用復(fù)雜數(shù)學(xué)公式,用大白話+生活化類比+對(duì)照實(shí)驗(yàn)代碼,從零講透學(xué)習(xí)率的底層邏輯、大小利弊、適配場(chǎng)景、科學(xué)調(diào)參方法、動(dòng)態(tài)優(yōu)化策略。學(xué)完本節(jié)課,你徹底告別盲目調(diào)參,精準(zhǔn)拿捏模型訓(xùn)練節(jié)奏,讓模型又快又穩(wěn)收斂。一、零基礎(chǔ)秒懂:學(xué)習(xí)率到底是什么?我們延續(xù)系列一貫的通俗類比,結(jié)合之前的下山優(yōu)化模型和學(xué)生刷題模型,一次性徹底理解學(xué)習(xí)率的核心作用。1、生活化核心類比前文我們講過(guò):模型訓(xùn)練就是梯度下山找最低點(diǎn),誤差Loss是山坡高度