你大概率遇到過這個場景:培訓結束後,主管問你「這次培訓效果怎麼樣?」你說了「大家回饋還不錯」,主管點了點頭,然後預算砍了。

問題不在於主管不信你。問題在於「大家回饋還不錯」這句話沒有任何資訊量。它既不能證明學習發生了,也不能證明行為改變了,更不能說明業務結果受到了影響。

培訓效果評估這件事,柯氏四級模型講了快七十年。但直到今天,大部分企業的培訓評估仍然停留在 L1——發一張滿意度問卷,算個平均分,完事。L2 到 L4 基本上是空白。

這篇就來拆解:四級評估到底每一級評什麼、怎麼評,以及為什麼從 L1 到 L4 中間會斷鏈。

柯氏四級:不是四個分數,是四個問題

先把柯氏四級模型的定義快速過一遍,但不是教科書式的複述——而是從「每一級在回答什麼問題」的角度來理解。

L1
反應層:學員覺得這個培訓怎麼樣?
最淺的一層。學員對內容、講師、形式的直觀感受。通常用滿意度問卷收集。回答的是「喜不喜歡」,不是「學沒學到」。
L2
學習層:學員學到了什麼?
知識、技能或態度有沒有變化。通常用前測後測來衡量。回答的是「會不會」,不是「用沒用」。
L3
行為層:學員回到崗位上做了什麼不同的事?
培訓內容有沒有轉化為實際行為改變。需要培訓後一段時間(通常1-3個月)的觀察或追蹤評估。回答的是「用沒用」,不是「有沒有用」。
L4
結果層:這些行為改變帶來了什麼業務結果?
對業務指標的影響——產量、品質、客戶滿意度、銷售額、離職率等。最難評的一層,也是管理層最關心的一層。

關鍵認知:四級評估不是「做了 L1 再做 L2 再做 L3 再做 L4」的線性流程。它是一個因果鏈——L1 是 L2 的前提(不喜歡的培訓很難學進去),L2 是 L3 的前提(沒學會的東西不可能用),L3 是 L4 的前提(行為不改業務結果不會變)。任何一環斷了,後面的都沒意義。

為什麼 L1 到 L4 會斷鏈

斷鏈不是某一個人的問題,是系統性的。原因大概有這麼幾個:

L1 到 L2 斷鏈:滿意度問卷做得太粗糙。如果你的問卷只問「講師表達清晰嗎」「內容有用嗎」這種題,你拿到的是一個「開心分數」——學員開心不代表學到了東西。有些人參加完一場很歡樂但內容很水的培訓,滿意度反而比乾貨培訓高。L1 評估設計得好的話,應該在滿意度之外加幾個「收穫感」的問題,比如「這場培訓中你學到的最有價值的一點是什麼」。這個開放題的回答品質,比滿意度分數更能預示 L2 的效果。

L2 到 L3 斷鏈:這是最常見的斷點。前測後測做得再好,也只能證明「在課堂上學會了」。但學會和會用之間隔著一條巨大的鴻溝——工作環境支不支援、主管鼓勵不鼓勵、有沒有時間練習、用了之後有沒有正向回饋。這些因素培訓部門控制不了。所以很多培訓的 L2 數據很好看,但三個月後回訪,發現大家還是老樣子。

L3 到 L4 斷鏈:行為改變了,但業務結果沒變。這種情況其實不少見。比如業務培訓後,業務人員的溝通技巧確實提升了(L3 有變化),但銷售額沒漲(L4 沒變化)。為什麼?可能因為產品定價有問題,可能因為市場競爭加劇,可能因為客戶預算縮減。業務結果受太多因素影響,很難單獨歸因到培訓上。

斷鏈不可怕,不知道斷在哪裡才可怕。四級評估的真正價值不是「四級都做到」——大部分企業做不到——而是讓你知道效果在哪個環節流失了,然後有針對性地修補。

每一級到底怎麼評

L1 反應層:滿意度問卷的升級

別只問「滿意度」。在問卷裡加入這幾類問題:

這三個問題的價值遠大於「講師講得好不好」。收穫感預示 L2,困惑點幫你改進課程設計,行動意願是 L3 的種子——如果學員在問卷裡寫不出任何行動意願,L3 基本沒戲。

L2 學習層:前測後測的正確姿勢

前測後測的核心不是「出幾道題」,是題目品質。好的 L2 測試題應該滿足:

如果培訓涉及技能操作,L2 還應該加一個實操考核,不只是紙筆測試。

L3 行為層:追蹤評估的設計

L3 是最難做但最關鍵的一級。方法無非兩種:

第一種是自評+他評。培訓後 4-8 週發一份行為自評問卷,問學員「你在多大程度上把培訓內容應用到了工作中」。然後發給他的直屬主管或同事做平行評價。自評和他評的差距本身就是一個有價值的數據——如果自評很高但他評很低,說明學員覺得自己在用但實際沒有,或者用得不對。

第二種是關鍵行為錨定。培訓前確定 3-5 個「如果培訓有效,學員應該開始做的具體行為」。比如溝通培訓後,關鍵行為可能是「在團隊會議中主動使用結構化表達框架」。然後讓主管在一段時間後評估這些行為出現的頻率。這種方法比泛泛的「你用了嗎」更有診斷價值。

L4 結果層:從行為到業務的歸因

L4 不需要每次培訓都做。大部分培訓做到 L3 就夠了。L4 適合用在那些投入大、週期長、跟核心業務指標直接相關的培訓專案上。

做 L4 的關鍵不是計算一個 ROI 數字,而是建立時間序列對照。培訓前的業務指標是什麼水準,培訓後 3-6 個月有沒有變化趨勢?當然,你需要排除其他變數的影響——這正是對比組設計要解決的問題,後面會專門講。

實操中怎麼選:不是每次都要做到 L4

一個務實的建議:根據培訓的重要程度決定評估深度。

別犯的錯誤:為了「做到 L4」而在不合適的培訓上硬套。一個兩小時的通用技能培訓,你花在評估上的時間比培訓本身還長,這不合理。評估的投入應該跟培訓的投入成正比。

工具怎麼選

評估工具的選擇取決於你要評哪一級:

L1 到 L3 這三級,都可以用結構化的評估工具來支撐。關鍵是工具要支援量表題(不是簡單的選擇題)、前後測對比、多輪追蹤、以及自動生成報告——手動做這些事情的工作量會把你壓垮。

🛠️ 在 FormLM 裡搭建你的培訓評估體系

柯氏四級的每一級都可以用 FormLM 的功能來落地:

  • 量表欄位設計 L1 滿意度問卷,加入收穫感和行動意願的開放題
  • 前測後測對比功能做 L2 學習評估,自動計算每位學員的得分變化
  • 分享連結在培訓後 4-8 週發送 L3 行為追蹤問卷,支援自評和他評
  • AI 報告自動生成每位學員的評估報告,雷達圖直觀展示能力維度變化
  • 統計概覽查看培訓的查看量、開始填寫量和完成量,監控評估參與率
開始搭建培訓評估工具 →

✅ 核心要點

  • 柯氏四級是因果鏈:L1 反應 → L2 學習 → L3 行為 → L4 結果,任何一環斷了後面沒意義
  • L1 最大的問題是只測「開心」不測「收穫」——加入行動意願和困惑點的開放題
  • L2 前測後測的關鍵是題目品質:測能力點、能區分學過沒學過、前後測等價但不相同
  • L3 是最關鍵的斷點:用自評+他評或關鍵行為錨定,培訓後 4-8 週追蹤
  • 不是每次培訓都要做到 L4——評估投入應與培訓投入成正比
  • 知道效果在哪個環節流失了,比「四級都做到」更重要
← 返回培訓效果評估專區 下一篇:培訓滿意度問卷設計 →