首頁 ai 學習率暖身計算 產生日期: 2026年7月20日 下午09:34 學習率暖身計算 輸入 峰值學習率0.0003最小學習率3e-5暖身步數2,000總步數100,000當前步數1,000 AI & LLM 學習率暖身計算 計算標準 Transformer 排程在任一訓練步驟的學習率:線性暖身至峰值,接著餘弦衰減趨向下限,並一併給出暖身佔比。 輸入 排程 峰值學習率 暖身結束時達到的最大學習率。線性上升爬升至此值,餘弦衰減也由此值起算,因此它決定了每一步的整體尺度。 最小學習率 餘弦衰減在最後一步趨近的下限,通常為峰值的一小部分。設為零則讓排程一路衰減到底。 暖身步數 學習率由零線性上升至峰值所經歷的步數。暖身可在最佳化器統計量尚未穩定前,穩定訓練初期。 總步數 ≥ 1 本次訓練的最佳化器總步數。餘弦衰減由暖身結束延伸至此步,學習率在此達到最小值。 當前步數 要讀取學習率的步數。不超過暖身長度的數值落在線性上升段;之後的數值落在餘弦衰減段。 結果 輸入數值即可顯示計算結果。 當前步數的學習率 排程在當前步數所規定的學習率,...,暖身期間落在線性上升段,之後落在餘弦曲線上。 詳細資料 暖身佔比 % 整次訓練用於暖身的比例,等於暖身步數除以總步數,...。大型模型訓練常選用百分之幾。 分享 列印報告 重設 嵌入 嵌入這個計算機 預覽 將這段程式碼貼到您的網頁中即可顯示計算機。 複製程式碼 分享這個計算 開啟此連結的人都會看到您填入的數值。 複製連結 分享至 XFacebookLINE 電子郵件 最後更新:2026-06-22 學習率暖身 學習率是類神經網路訓練中影響最深遠的單一超參數,而現代 Transformer 鮮少讓它維持不變。標準配方在最初數步把它由零提升至峰值,之後在訓練其餘過程中沿餘弦曲線衰減趨向一個小下限。本計算回傳此排程下任一選定步數的學習率,並附上訓練用於暖身的比例。 學習率為何隨時間變化 訓練之初權重為隨機值,最佳化器對梯度統計量的滑動估計並不可靠,因此劇烈的更新可能使損失發散。短暫的暖身期間學習率由零線性爬升,可在最佳化器穩定的同時,讓初期更新維持在小幅度。暖身結束後,高學習率加速進展,但若一路維持高檔,模型只會在極小值附近來回擺盪而無法安定。讓學習率衰減,此處沿餘弦曲線,能使模型在初期邁出大步,並隨收斂逐步邁出更細的步伐。 排程 兩個階段主宰學習率。暖身期間,當前步數 ss 不超過暖身長度 ww 時,學習率線性上升至峰值 ηmax\eta_{max}。暖身之後,學習率在直到總步數 SS 的其餘步數內,由峰值餘弦衰減趨向下限 ηmin\eta_{min}。 η=ηmax sw(s≤w)η=ηmin+12(ηmax−ηmin) (1+cosπ(s−w)S−w)(s>w)\begin{aligned} \eta &= \eta_{max}\,\frac{s}{w} && (s \le w) \\ \eta &= \eta_{min} + \tfrac{1}{2}(\eta_{max}-\eta_{min})\!\left(1 + \cos\frac{\pi (s-w)}{S-w}\right) && (s > w) \end{aligned}ηη=ηmaxws=ηmin+21(ηmax−ηmin)(1+cosS−wπ(s−w))(s≤w)(s>w) 暖身佔比即為 w/Sw / S。在衰減的中點,餘弦項為零,因此學習率恰好落在峰值與下限的正中央。 計算範例 取峰值 0.0003、下限 0.00003、暖身 2,000 步、總共 100,000 步。在第 1,000 步(仍處暖身內)與第 51,000 步(衰減中點),學習率為 η1000=0.0003×10002000=0.00015η51000=0.00003+12(0.0003−0.00003)(1+cosπ2)=0.000165\begin{aligned} \eta_{1000} &= 0.0003 \times \frac{1000}{2000} = 0.00015 \\ \eta_{51000} &= 0.00003 + \tfrac{1}{2}(0.0003 - 0.00003)(1 + \cos\tfrac{\pi}{2}) = 0.000165 \end{aligned}η1000η51000=0.0003×20001000=0.00015=0.00003+21(0.0003−0.00003)(1+cos2π)=0.000165 暖身過半時學習率為峰值的一半。在餘弦等於零的衰減中點,學習率恰落在峰值與下限之間。此處暖身佔 100,000 步中的 2,000 步,即訓練的 2%。 數值的選擇 峰值學習率主宰整份排程,通常以經驗求得,常用一次範圍測試逐步提高學習率,直到損失不再改善。大型 Transformer 已發表的峰值常落在約 1e-4 至 6e-4 之間,且峰值傾向隨批次大小縮放,因此改變有效批次大小一般需要重新調校。暖身數百至數千步、常為訓練的一小百分比,是典型做法。下限常設為峰值的約十分之一,或在需要完全衰減時設為零。 適用限制 各框架在本模型未涵蓋的細節上有所不同:有些以詞元而非步數衡量排程,有些將下限參數化為峰值的比例,有些在尾端加上固定或線性的延伸段。此處的「餘弦加暖身」形式是常見預設,但合適的超參數因問題而異,應以實驗確認。給定步數所代表的算力由 訓練時間與成本計算估算,其背後的硬體帳單則由 GPU 雲端成本計算機計算。 常見問題(FAQ)為何要將學習率暖身,而非直接從峰值開始訓練初期最佳化器掌握的可靠資訊極少:適應性方法對梯度統計量的滑動估計含有雜訊,隨機初始化的權重又會產生劇烈而不穩的更新。在此狀態下直接以完整峰值學習率起步,可能使訓練失穩或發散。 在最初數步逐漸提高學習率,可在更新仍小時讓最佳化器穩定下來,之後即可安全套用峰值學習率。暖身對大批次與深層 Transformer 尤其重要,因為其初期不穩更為明顯。 本計算採用的是何種排程它採用多數現代 Transformer 訓練所用的排程:在暖身步數內由零線性暖身至峰值,接著在其餘步數內由峰值餘弦衰減趨向最小值。餘弦形狀在衰減初期花較多時間維持在高學習率,並在尾端平緩地趨近下限,經驗上訓練效果良好。 其他排程亦存在,例如固定、線性衰減、平方根倒數與階梯衰減,但線性暖身搭配餘弦衰減是本工具重現的常見預設。 峰值學習率如何選定峰值學習率是排程中最重要的超參數,通常以經驗求得,常用一次簡短的範圍測試:逐步提高學習率,直到損失不再改善後再回退。 大型 Transformer 已發表的數值,最大型者常落在約 1e-4 至 6e-4 之間,較小的模型則可容忍稍高的學習率。峰值通常隨批次大小縮放,因此有效批次大小一旦改變,往往需要重新調校。 免責聲明 本工具重現常見的「線性暖身後餘弦衰減」排程;實際框架在細節上各異,例如衰減以步數或詞元衡量,以及下限的參數化方式。最佳超參數因問題而異,應以實驗確認。 推薦的下一個 有效批次大小計算 由每裝置微批次、資料平行裝置數與梯度累積步數,計算分散式訓練的有效(全域)批次大小,並給出每次最佳化步驟的詞元數。 深入了解訓練時間與成本計算 由總訓練 FLOPs、GPU 數量、每 GPU 峰值 TFLOP/s、模型 FLOPs 使用率與每小時 GPU 租金,估算一次 LLM 訓練的耗時與成本。 深入了解 200+ 計算機 · 10 種語言 · 完全免費 更多training 有效批次大小計算訓練 FLOPs 計算梯度累積記憶體計算機資料平行擴展計算資料集詞元數計算學習率暖身計算 +6 more Show less 算力最佳模型大小計算算力預算可訓練輪數計算管線平行氣泡計算Chinchilla 最佳詞元數計算LLM 訓練 VRAM 計算機LoRA 參數計算機 其他ai計算機 cost 文字轉語音成本計算機代理人成本計算機向量資料庫大小計算機向量資料庫成本計算機自架與 API 損益平衡計算機批次 API 節省計算機每元詞元數計算機系統提示攤提計算機函式呼叫詞元額外負擔計算機音訊轉錄成本計算機訓練時間與成本計算訓練碳足跡計算情境成本增長計算機情境視窗容納計算機推論能源成本計算機嵌入成本計算機提示快取節省計算機結構化輸出額外負擔計算機詞元成本計算機詞元轉字數計算機微調成本計算影像生成成本計算機GPU 利用率成本計算器GPU 雲端成本計算機LLM 每月成本計算機LLM 速率限制規劃計算機inference 多模態影像詞元計算器有效每秒標記數計算器批次推論吞吐量計算器每標記 FLOP 計算機推測解碼加速計算機推論吞吐量計算器推論延遲計算器模型 FLOP 使用率計算機infrastructure 注意力記憶體計算機專家混合活躍參數計算機量化模型大小計算器模型下載時間計算器GPU 數量需求計算機KV 快取大小計算機LLM 推論 VRAM 計算器Transformer 參數量計算機retrieval RAG 分塊計算器evaluation 困惑度計算器A/B 測試顯著性計算器LLM 評估樣本數計算器pass@k 計算器所有工具 餘弦相似度計算器 這個計算機對您有幫助嗎? 有幫助 需要改進 需要改進 我們可以如何改進這個計算機? 送出回饋 由 OneCalc 提供 ↗
最後更新:2026-06-22 學習率暖身 學習率是類神經網路訓練中影響最深遠的單一超參數,而現代 Transformer 鮮少讓它維持不變。標準配方在最初數步把它由零提升至峰值,之後在訓練其餘過程中沿餘弦曲線衰減趨向一個小下限。本計算回傳此排程下任一選定步數的學習率,並附上訓練用於暖身的比例。 學習率為何隨時間變化 訓練之初權重為隨機值,最佳化器對梯度統計量的滑動估計並不可靠,因此劇烈的更新可能使損失發散。短暫的暖身期間學習率由零線性爬升,可在最佳化器穩定的同時,讓初期更新維持在小幅度。暖身結束後,高學習率加速進展,但若一路維持高檔,模型只會在極小值附近來回擺盪而無法安定。讓學習率衰減,此處沿餘弦曲線,能使模型在初期邁出大步,並隨收斂逐步邁出更細的步伐。 排程 兩個階段主宰學習率。暖身期間,當前步數 ss 不超過暖身長度 ww 時,學習率線性上升至峰值 ηmax\eta_{max}。暖身之後,學習率在直到總步數 SS 的其餘步數內,由峰值餘弦衰減趨向下限 ηmin\eta_{min}。 η=ηmax sw(s≤w)η=ηmin+12(ηmax−ηmin) (1+cosπ(s−w)S−w)(s>w)\begin{aligned} \eta &= \eta_{max}\,\frac{s}{w} && (s \le w) \\ \eta &= \eta_{min} + \tfrac{1}{2}(\eta_{max}-\eta_{min})\!\left(1 + \cos\frac{\pi (s-w)}{S-w}\right) && (s > w) \end{aligned}ηη=ηmaxws=ηmin+21(ηmax−ηmin)(1+cosS−wπ(s−w))(s≤w)(s>w) 暖身佔比即為 w/Sw / S。在衰減的中點,餘弦項為零,因此學習率恰好落在峰值與下限的正中央。 計算範例 取峰值 0.0003、下限 0.00003、暖身 2,000 步、總共 100,000 步。在第 1,000 步(仍處暖身內)與第 51,000 步(衰減中點),學習率為 η1000=0.0003×10002000=0.00015η51000=0.00003+12(0.0003−0.00003)(1+cosπ2)=0.000165\begin{aligned} \eta_{1000} &= 0.0003 \times \frac{1000}{2000} = 0.00015 \\ \eta_{51000} &= 0.00003 + \tfrac{1}{2}(0.0003 - 0.00003)(1 + \cos\tfrac{\pi}{2}) = 0.000165 \end{aligned}η1000η51000=0.0003×20001000=0.00015=0.00003+21(0.0003−0.00003)(1+cos2π)=0.000165 暖身過半時學習率為峰值的一半。在餘弦等於零的衰減中點,學習率恰落在峰值與下限之間。此處暖身佔 100,000 步中的 2,000 步,即訓練的 2%。 數值的選擇 峰值學習率主宰整份排程,通常以經驗求得,常用一次範圍測試逐步提高學習率,直到損失不再改善。大型 Transformer 已發表的峰值常落在約 1e-4 至 6e-4 之間,且峰值傾向隨批次大小縮放,因此改變有效批次大小一般需要重新調校。暖身數百至數千步、常為訓練的一小百分比,是典型做法。下限常設為峰值的約十分之一,或在需要完全衰減時設為零。 適用限制 各框架在本模型未涵蓋的細節上有所不同:有些以詞元而非步數衡量排程,有些將下限參數化為峰值的比例,有些在尾端加上固定或線性的延伸段。此處的「餘弦加暖身」形式是常見預設,但合適的超參數因問題而異,應以實驗確認。給定步數所代表的算力由 訓練時間與成本計算估算,其背後的硬體帳單則由 GPU 雲端成本計算機計算。 常見問題(FAQ)為何要將學習率暖身,而非直接從峰值開始訓練初期最佳化器掌握的可靠資訊極少:適應性方法對梯度統計量的滑動估計含有雜訊,隨機初始化的權重又會產生劇烈而不穩的更新。在此狀態下直接以完整峰值學習率起步,可能使訓練失穩或發散。 在最初數步逐漸提高學習率,可在更新仍小時讓最佳化器穩定下來,之後即可安全套用峰值學習率。暖身對大批次與深層 Transformer 尤其重要,因為其初期不穩更為明顯。 本計算採用的是何種排程它採用多數現代 Transformer 訓練所用的排程:在暖身步數內由零線性暖身至峰值,接著在其餘步數內由峰值餘弦衰減趨向最小值。餘弦形狀在衰減初期花較多時間維持在高學習率,並在尾端平緩地趨近下限,經驗上訓練效果良好。 其他排程亦存在,例如固定、線性衰減、平方根倒數與階梯衰減,但線性暖身搭配餘弦衰減是本工具重現的常見預設。 峰值學習率如何選定峰值學習率是排程中最重要的超參數,通常以經驗求得,常用一次簡短的範圍測試:逐步提高學習率,直到損失不再改善後再回退。 大型 Transformer 已發表的數值,最大型者常落在約 1e-4 至 6e-4 之間,較小的模型則可容忍稍高的學習率。峰值通常隨批次大小縮放,因此有效批次大小一旦改變,往往需要重新調校。 免責聲明 本工具重現常見的「線性暖身後餘弦衰減」排程;實際框架在細節上各異,例如衰減以步數或詞元衡量,以及下限的參數化方式。最佳超參數因問題而異,應以實驗確認。