你大概率遇到過這個場景:培訓結束後,主管問你「這次培訓效果怎麼樣?」你說了「大家回饋還不錯」,主管點了點頭,然後預算砍了。
問題不在於主管不信你。問題在於「大家回饋還不錯」這句話沒有任何資訊量。它既不能證明學習發生了,也不能證明行為改變了,更不能說明業務結果受到了影響。
培訓效果評估這件事,柯氏四級模型講了快七十年。但直到今天,大部分企業的培訓評估仍然停留在 L1——發一張滿意度問卷,算個平均分,完事。L2 到 L4 基本上是空白。
這篇就來拆解:四級評估到底每一級評什麼、怎麼評,以及為什麼從 L1 到 L4 中間會斷鏈。
柯氏四級:不是四個分數,是四個問題
先把柯氏四級模型的定義快速過一遍,但不是教科書式的複述——而是從「每一級在回答什麼問題」的角度來理解。
關鍵認知:四級評估不是「做了 L1 再做 L2 再做 L3 再做 L4」的線性流程。它是一個因果鏈——L1 是 L2 的前提(不喜歡的培訓很難學進去),L2 是 L3 的前提(沒學會的東西不可能用),L3 是 L4 的前提(行為不改業務結果不會變)。任何一環斷了,後面的都沒意義。
為什麼 L1 到 L4 會斷鏈
斷鏈不是某一個人的問題,是系統性的。原因大概有這麼幾個:
L1 到 L2 斷鏈:滿意度問卷做得太粗糙。如果你的問卷只問「講師表達清晰嗎」「內容有用嗎」這種題,你拿到的是一個「開心分數」——學員開心不代表學到了東西。有些人參加完一場很歡樂但內容很水的培訓,滿意度反而比乾貨培訓高。L1 評估設計得好的話,應該在滿意度之外加幾個「收穫感」的問題,比如「這場培訓中你學到的最有價值的一點是什麼」。這個開放題的回答品質,比滿意度分數更能預示 L2 的效果。
L2 到 L3 斷鏈:這是最常見的斷點。前測後測做得再好,也只能證明「在課堂上學會了」。但學會和會用之間隔著一條巨大的鴻溝——工作環境支不支援、主管鼓勵不鼓勵、有沒有時間練習、用了之後有沒有正向回饋。這些因素培訓部門控制不了。所以很多培訓的 L2 數據很好看,但三個月後回訪,發現大家還是老樣子。
L3 到 L4 斷鏈:行為改變了,但業務結果沒變。這種情況其實不少見。比如業務培訓後,業務人員的溝通技巧確實提升了(L3 有變化),但銷售額沒漲(L4 沒變化)。為什麼?可能因為產品定價有問題,可能因為市場競爭加劇,可能因為客戶預算縮減。業務結果受太多因素影響,很難單獨歸因到培訓上。
斷鏈不可怕,不知道斷在哪裡才可怕。四級評估的真正價值不是「四級都做到」——大部分企業做不到——而是讓你知道效果在哪個環節流失了,然後有針對性地修補。
每一級到底怎麼評
L1 反應層:滿意度問卷的升級
別只問「滿意度」。在問卷裡加入這幾類問題:
- 收穫感:「今天學到的內容,你預計在工作中能用上多少?」(1-5分)
- 困惑點:「今天的內容中,你覺得最難落地的是哪部分?」(開放題)
- 行動意願:「你打算在接下來一週內嘗試做的一件事是什麼?」(開放題)
這三個問題的價值遠大於「講師講得好不好」。收穫感預示 L2,困惑點幫你改進課程設計,行動意願是 L3 的種子——如果學員在問卷裡寫不出任何行動意願,L3 基本沒戲。
L2 學習層:前測後測的正確姿勢
前測後測的核心不是「出幾道題」,是題目品質。好的 L2 測試題應該滿足:
- 測的是培訓目標裡的能力點,不是泛泛的知識記憶
- 難度能區分「學過」和「沒學過」的人——如果所有人都拿滿分,題目太簡單了
- 後測和前測用不同題但等價——同一套題前後測兩次,第二次分數高可能是記憶效應不是學習效果
如果培訓涉及技能操作,L2 還應該加一個實操考核,不只是紙筆測試。
L3 行為層:追蹤評估的設計
L3 是最難做但最關鍵的一級。方法無非兩種:
第一種是自評+他評。培訓後 4-8 週發一份行為自評問卷,問學員「你在多大程度上把培訓內容應用到了工作中」。然後發給他的直屬主管或同事做平行評價。自評和他評的差距本身就是一個有價值的數據——如果自評很高但他評很低,說明學員覺得自己在用但實際沒有,或者用得不對。
第二種是關鍵行為錨定。培訓前確定 3-5 個「如果培訓有效,學員應該開始做的具體行為」。比如溝通培訓後,關鍵行為可能是「在團隊會議中主動使用結構化表達框架」。然後讓主管在一段時間後評估這些行為出現的頻率。這種方法比泛泛的「你用了嗎」更有診斷價值。
L4 結果層:從行為到業務的歸因
L4 不需要每次培訓都做。大部分培訓做到 L3 就夠了。L4 適合用在那些投入大、週期長、跟核心業務指標直接相關的培訓專案上。
做 L4 的關鍵不是計算一個 ROI 數字,而是建立時間序列對照。培訓前的業務指標是什麼水準,培訓後 3-6 個月有沒有變化趨勢?當然,你需要排除其他變數的影響——這正是對比組設計要解決的問題,後面會專門講。
實操中怎麼選:不是每次都要做到 L4
一個務實的建議:根據培訓的重要程度決定評估深度。
- 常規培訓(入職培訓、通用技能培訓):做到 L1+L2 就夠了。重點放在問卷設計和前後測品質上。
- 重點培訓(管理培訓、業務培訓、關鍵技術培訓):做到 L3。加一個 4-8 週的行為追蹤評估。
- 戰略級培訓(文化變革、組織能力提升、核心崗位能力重建):做到 L4。需要設計對比組,追蹤 6 個月以上的業務指標變化。
別犯的錯誤:為了「做到 L4」而在不合適的培訓上硬套。一個兩小時的通用技能培訓,你花在評估上的時間比培訓本身還長,這不合理。評估的投入應該跟培訓的投入成正比。
工具怎麼選
評估工具的選擇取決於你要評哪一級:
- L1 滿意度問卷:任何表單工具都行,關鍵是題目設計
- L2 前測後測:需要一個能做前後對比的工具——支援同一評估的兩次提交並自動計算差值
- L3 行為追蹤:需要一個能做延遲評估(培訓後4-8週再發問卷)且支援多角色評價的工具
- L4 業務結果:培訓工具解決不了,需要對接業務數據系統
L1 到 L3 這三級,都可以用結構化的評估工具來支撐。關鍵是工具要支援量表題(不是簡單的選擇題)、前後測對比、多輪追蹤、以及自動生成報告——手動做這些事情的工作量會把你壓垮。
🛠️ 在 FormLM 裡搭建你的培訓評估體系
柯氏四級的每一級都可以用 FormLM 的功能來落地:
- 用量表欄位設計 L1 滿意度問卷,加入收穫感和行動意願的開放題
- 用前測後測對比功能做 L2 學習評估,自動計算每位學員的得分變化
- 用分享連結在培訓後 4-8 週發送 L3 行為追蹤問卷,支援自評和他評
- 用AI 報告自動生成每位學員的評估報告,雷達圖直觀展示能力維度變化
- 用統計概覽查看培訓的查看量、開始填寫量和完成量,監控評估參與率
✅ 核心要點
- 柯氏四級是因果鏈:L1 反應 → L2 學習 → L3 行為 → L4 結果,任何一環斷了後面沒意義
- L1 最大的問題是只測「開心」不測「收穫」——加入行動意願和困惑點的開放題
- L2 前測後測的關鍵是題目品質:測能力點、能區分學過沒學過、前後測等價但不相同
- L3 是最關鍵的斷點:用自評+他評或關鍵行為錨定,培訓後 4-8 週追蹤
- 不是每次培訓都要做到 L4——評估投入應與培訓投入成正比
- 知道效果在哪個環節流失了,比「四級都做到」更重要
