本文的證據定位(請先讀這一句)
本文的實證支柱是 desirable difficulties(實驗心理學傳統,多為實驗室與教室研究)、productive failure(統合分析多來自中小學與大學的數理領域)、以及醫學教育內的測驗式學習與間隔學習。「cognitive friction」與「productive struggle」這兩個詞本身都不是有標準化定義的醫學教育實證術語;「摩擦設計改善臨床能力或病人結果」在本文檢視的文獻範圍內尚未見直接證據。文中的臨床落地清單屬「證據知情(evidence-informed)」的原則外推,效果需在各自場域驗證,且任何摩擦設計都以不影響真實病人照護安全為前提。全文逐處標明證據強度,文末附證據速查表。
一句話定位:productive struggle(建設性掙扎)是學習者端的歷程——教育者想讓學習者經歷的狀態;cognitive friction(認知摩擦)是環境端的設計手段——刻意放進學習流程裡的阻力。摩擦是劑量,掙扎是反應,學習是療效;而且和藥一樣,有治療窗、有毒性、有禁忌症。
壹起點:AMEE 2026 開幕演講的一行字
AMEE 2026(維也納)開幕 plenary 上,Brian Hodges(University of Toronto)以「Raising the Stakes: The Power and Potential of Examination for Learning」為題,列出六項「實證的、友善學習的科技」。每一項都是「學習科學原則:科技載體」的配對,其中第五項寫著——
Productive Struggle: Cognitive FrictionAMEE 2026 開幕 plenary 投影片第五項(依現場投影片轉錄)
整場演講的敘事是:當知識從大腦搬到雲端、再走向 AI 輔助推理,「記得多少」不再是能力的代理指標;但同一場演講也警告,AI 讓學習的預設值變成「毫無阻力」,而學習科學數十年的證據恰恰指向相反的方向——能力是從適度的困難裡長出來的。Hodges 引用的開場故事是著名的倫敦計程車司機研究:通過 The Knowledge 考試(依演講轉述,須熟記約 2.5 萬條街道)的司機,其空間記憶相關的海馬迴結構與對照組不同,且後海馬迴灰質與駕駛年資相關;行駛固定路線的公車司機則無此發現橫斷面——長期導航經驗與海馬迴結構差異相關,與「經驗驅動可塑性」的解釋一致(橫斷面研究不能確立因果,但方向發人深省)。
這一頁投影片把兩個出身完全不同的詞焊在一起。要正確使用它們,得先把各自的來歷說清楚。
貳先把兩個詞說清楚
Productive struggle(建設性掙扎)——教育研究的老概念
出自教育研究。Hiebert 與 Grouws(2007)在數學教育研究手冊中,把「讓學生有機會掙扎」列為促進概念理解的關鍵教學特徵之一:努力去搞懂當下還不明白的東西——並明確劃界,掙扎應落在學生能力可及的範圍,不是無謂的挫折(本條為二手引述,原章未直接取得全文)。原始價值判斷是正面的:掙扎是概念學習的必要成分。
同族概念:desirable difficulties(Bjork,見第參節)、productive failure(Kapur,見第肆節)、以及 Vygotsky 的近側發展區(ZPD)與鷹架(scaffolding)。
Cognitive friction(認知摩擦)——出身 UX、原本是個負面詞
出自互動設計。Alan Cooper 在《The Inmates Are Running the Asylum》(1999)造出此詞,指人與「規則隨情境改變的複雜系統」互動時遭遇的智識阻力(例:微波爐同一組數字鍵在不同模式下代表火力或時間)。在 UX 傳統裡,摩擦是設計缺陷、應該被消除(本條亦為二手引述)。
2024–2026 年的 AI 教育論述把它「翻轉」成正面設計語彙:既然生成式 AI 把學習流程變得毫無阻力,教育者就要刻意把摩擦設計回去(所謂 friction architect——評論用語,非實證術語)。它至今不是有成熟實證定義的教育學術語;其正當性必須錨定在 productive struggle 這一側的實證傳統上。
兩者的關係,投影片的句法已經講完:摩擦是輸入,掙扎是反應;掙扎是目的,摩擦是工程。Hodges 把 cognitive friction 放在「科技」欄位的意義在於——在 AI 時代,摩擦本身成了一種需要刻意配置的教育設計元素,而它的劑量學,來自下面兩節的老證據。
參理論底層(Bjork):學習不等於表現
1994 年,UCLA 心理學家 Robert Bjork 在一篇經典章節中提出「desirable difficulties(有益的困難)」:許多加速訓練中表現進步的操弄,無助於長期的訓練後表現;反之,許多看似替學習者製造困難的操弄,反而增強長期保留與遷移。理論核心是「學習 ≠ 表現」:表現(performance)當下可測,學習(learning)只能在延遲後間接測得。Bjork 與 Bjork(2020)用「儲存強度/提取強度」的框架進一步說明:當下提取強度越高(越流暢),重讀或再提取帶來的儲存強度增益越小——所以「遺忘(提取強度下降)反而能促成學習」,這正是間隔與變化有效的機轉。
原典中的五類「有益的困難」
| 操弄 | 訓練中的表現 | 長期保留/遷移 | 代表證據(皆見 Bjork 1994 所引) |
| 變化練習條件(隨機排程、參數變動) | 變差 | 變好 | Shea & Morgan 1979(隨機勝過分塊,連「分塊型測驗」都是隨機組贏);Kerr & Booth 1978(丟沙包練 2 與 4 呎,測 3 呎時勝過只練 3 呎的組) |
| 情境干擾/交錯 | 變差 | 變好 | Mannes & Kintsch 1987(不一致大綱使逐字回憶較差,但推論與解題較好) |
| 間隔練習 | 變差 | 變好 | Bahrick 1979:三次訓練以 30 天間隔,30 天後保留 72%;同日集中與間隔 1 天分別只有 33% 與 64% |
| 減少回饋頻率 | 變差 | 變好 | Schmidt 等(摘要式、漸減式回饋損害習得、利於長期保留) |
| 把測驗當學習事件 | 變差 | 變好 | Hogan & Kintsch 1971(讀書組贏在當下、測驗組贏在 48 小時後);Landauer & Bjork 1978(擴增式提取練習) |
為什麼沒人想用:流暢感的三重陷阱
- 學習者被自己騙:進步快讓人安心(即使沒學到什麼),掙扎犯錯讓人沮喪(即使學到很多)。Baddeley 與 Longman(1978)的英國郵務員鍵盤訓練實驗裡,集中練習組學得較沒效率、卻對訓練更滿意。
- 教師被學員騙:Bjork 直指訓練者受一種「操作制約」——學員當下的表現與滿意度是強化物,久了自然滑向讓學員舒服的教法;而機構又常以「訓練中/訓練結束時的表現」考核教師,且教師幾乎看不到學員結訓後的真實表現。
- 後設認知被流暢感騙:以「現在提取的順暢度」推估「學會的程度」是不可靠的指標——分塊練習、連續回饋、固定情境都像「拐杖」,撐高訓練中的表現;拐杖一抽,表現崩塌。
「進行任何實質的學習時,令人不安的應該是錯誤與困難的缺席,而不是它們的出現。」Robert A. Bjork, 1994(中譯;原文:…we should probably find the absence, not the presence, of errors, mistakes, and difficulties to be distressing…)
困難要成為「有益的」,是有前提的(Bjork & Bjork 2020):學習者必須具備成功回應該困難的背景知識與技能;否則它就是單純的(undesirable)困難。最適難度隨先備學習程度而變——這正是「掙扎要落在能力邊緣」的理論版本。
肆把掙扎做成設計:productive failure(Kapur)
如果 Bjork 回答「哪些困難有益」,新加坡/蘇黎世聯邦理工的 Manu Kapur 則回答「怎麼把掙扎排進課程」。他利用「學習與表現不可通約」把教學設計切成 2×2(Kapur 2016)框架論文:
| 短期表現好 | 短期表現差 |
| 長期學習好 | Productive success——鷹架充分的問題導向學習(PBL、引導式探究) | Productive failure——先讓學生解「還沒教過」的問題(通常會失敗),再以教學收攏 |
| 長期學習差 | Unproductive success——反覆操練與死背:表現亮眼、理解沒跟上,是「學習的假象」。Kapur 論證:相對於 PF/PS,連傳統直接教學都可能落在這格 | Unproductive failure——毫無引導的純發現式學習(兩派學者難得共識地反對) |
Productive failure 的兩階段:先「生成」(讓學生用先備知識產出多個次佳、甚至錯誤的解法),後「收攏」(教師把學生解法與正解對照比較,指出關鍵特徵)。機轉有三:活化並分化先備知識;讓學生意識到自己知識的缺口;以及在對照中更深地編碼新概念的關鍵特徵。有趣的是,Kapur(2011)與 Loibl 與 Rummel(2013)都發現:在生成階段給予引導確實讓學生「解對」了,但事後學習並沒有更好——初期的解題成功本身不是重點,被活化的先備知識與被暴露的缺口才是。
統合分析量級(Sinha 與 Kapur 2021;53 篇研究、166 組比較):「先解題後教學(PS-I)」整體優於「先教學後解題(I-PS)」,Hedges' g 0.36(95% CI 0.20–0.51);依 PF 設計準則高擬真執行時 g 0.37–0.58;校正發表偏差後的真實效應估計更高(g 0.87)。收益集中在概念理解與遷移;程序知識則未檢出顯著差異(信賴區間仍容許小幅利弊,長期流暢度亦未被充分評估)。所謂高擬真,指問題能引出多元解法與表徵、有情感吸引力(真實情境、對比案例)、有小組與社會支持,且教學階段連結學生生成的解法(統合分析中與較大效應量相關的 fidelity 準則之一)——不是把學生丟進困難就叫 productive failure。
適用邊界(同一篇統合分析):年幼學習者(約小二至小五)與「領域一般技能」的效應反轉、偏向先教學。把掙扎設計用在成人、領域特定知識(如醫學教育)較符合證據所在的範圍;對全新領域的純新手,先給結構仍是合理預設。
與醫學教育的直接關聯:Kapur 歸類為 productive success 的 PBL,其統合分析大多來自醫學生——Vernon 與 Blake(1993)發現直接教學利於基礎知識、PBL 利於臨床應用;Dochy 等(2003)更發現直接教學在基礎知識上的優勢,到醫學院二年級之後就消失了;Schmidt 等(2009)彙整 270 組比較,PBL 在知識與診斷推理有小幅正效應、在臨床技能效應更強(皆見 Kapur 2016 所引)。換句話說,醫學教育其實早就在大規模使用「有鷹架的掙扎」。
伍你已經在用的摩擦:測驗與間隔
回頭看那頁投影片的第一、三項——「持續低風險測驗」與「間隔重複練習」——它們本身就是 Bjork 清單上的兩種經典有益困難。也就是說,第五項(認知摩擦)是第一、三項的上位原則;而這兩項是醫學教育裡研究累積最多的摩擦:
- 測驗增強學習(test-enhanced learning)綜述:Larsen、Butler 與 Roediger(2008)是把認知心理學測驗效應帶進醫學教育的代表性論文——考試不是中性的測量工具,而是主動的學習工具;要「頻繁且間隔」,費力提取(如簡答)優於再認(如選擇);沒有回饋時測驗效應依然存在,但提供回饋通常能進一步增強保留、並避免錯誤答案被固化。
- 系統性回顧BEME Guide No. 48(2018):19 篇對照研究、41 個學習成果——與同時間重讀相比,保留成果 21/23(SMD 0.12–2.5)、遷移成果 7/7(SMD 0.33–1.1)方向上有利於測驗式學習,形式並延伸到模擬與標準化病人;須注意並非每個結果都達統計顯著、效應量異質(2.5 為離群值),該回顧亦因異質性未做合併效應估計。
- 間隔(spaced education)RCT:Kerfoot 等(2007)用每週 email 臨床情境題做間隔提取,年終綜合測驗顯著改善(P<0.001),且在該研究中,對 6–8 與 9–11 個月前完成該科訓練者效應量最大(Cohen's d 1.01 與 0.73)——提示間隔提取對較遠期的保留特別有幫助(單一學校、單一學科的研究,外推宜保守)。急救訓練端,AHA 2018 復甦教育科學聲明科學聲明指出標準課程後技能持續衰退,建議以「更短、更頻繁」的間隔學習(如每 3–6 個月 1–2 小時)取代每兩年一次的集中課程。
把六項讀成一個系統:低風險持續測驗與間隔練習(#1、#3)是摩擦的具體形式;鷹架與 progress testing(#2)把摩擦維持在可承受區間並畫出成長曲線;learning analytics(#4)幫你調劑量;後設認知與批判性反思(#6)是學習者對自身掙扎的監控迴路。它們不是六個並列的 buzzword,是一部咬合的機器。(此為本文對投影片結構的詮釋。)
陸AI 把摩擦變成稀缺品
在生成式 AI 之前,摩擦是學習流程的預設值:查書、手算、自己寫草稿。教學建議只需要「忍住,不要把困難移除」。生成式 AI 把預設值改成毫無阻力——答案即時、成品即得,掙扎不再自然發生。於是有益的困難從「本來就在」變成「必須刻意設計回去」。
實驗實證警訊已經出現。Fan 等(2025)把 117 名大學生隨機分為四組完成同一份英文閱讀寫作任務:無支援、ChatGPT、真人專家、寫作分析工具。結果:ChatGPT 組的作文改善分數顯著最高(p=0.005;比其他三組各多約 2 分),但知識獲得(p=0.438)與知識遷移(p=0.996)皆未檢出組間顯著差異——無差異不等於證明相等,但「AI 讓成品變好」至少沒有同步反映在知識測驗上;內在動機亦無組間差異,自我調節學習歷程卻顯著不同:AI 組的評估、定向等後設認知活動較少、學習歷程繞著 ChatGPT 打轉。作者將此解釋為可能的「後設認知怠惰(metacognitive laziness)」——把後設認知負荷卸載給 AI 的傾向,尚待更多場域驗證。
這就是「認知摩擦」在 AI 時代被翻轉成正面詞的原因。但要用對,得分清楚好摩擦與壞摩擦:
值得設計的摩擦(認知性阻力)
迫使學習者提取、生成、比較、批判——增加的是基模建構的努力(認知負荷理論所稱 germane load)。例:先作答再看解析;先寫下判斷再問 AI;要求批判 AI 輸出、找出錯誤;延遲回饋;交錯病例。判準:阻力落在學習目標本身,且學習者具備回應它的先備能力。
仍然該消除的摩擦(操作性阻力)
介面難用、指令不清、流程冗贅——Cooper 1999 原義的摩擦(extraneous load)。例:難找的按鈕、反覆登入、模糊的作業說明、為難而難的題目。判準:阻力落在與學習目標無關的雜訊。
「加摩擦」不是「把課變難」的通行證。劑量學三原則:①落點在能力邊緣(太易=無效劑量;太難無支持=毒性:挫折、放棄、習得無助);②有鷹架與心理安全承接(Kapur 的收攏階段、Vygotsky 的 ZPD);③學習者要能把掙扎詮釋為「正在變強」——同樣的劑量,詮釋不同,反應就不同(此第③點為成長心態文獻的原則性延伸,非本文引用研究的直接發現)。
柒臨床教學的落地清單(證據知情的外推)
床邊與模擬
- 先問「你認為是什麼、為什麼」,讓學員 commit 到一個判斷再給資訊(one-minute preceptor 的 get a commitment 可視為同一原理的床邊版本)。
- 模擬中忍住不急著提示,讓團隊走到決策點再進 debriefing——此原則僅限模擬與教學情境,且應預設停止規則與救援提示;真實病人照護中不得為了「製造摩擦」延遲必要的資訊、督導或決策支援。
- 擬真度追求「心理擬真」而非「工程擬真」——Bjork 1994 引述的模擬器文獻指出:高工程擬真不保證較佳學習,過多線索與複雜度可能干擾初學者(但某些技能確實需要高擬真,依學習目標決定);關鍵是訓練中演練到「之後真實環境會要求的那種處理歷程」。
- 技能訓練排程用交錯與變化(不同病例型態混排),別整批同型。
課程與在職教育
- 用每週數題的低風險測驗(email/LINE 題庫)補充或部分取代重讀講義——實施成本低、且有系統性回顧與 RCT 支持的保留介入(不是取代初始教學,也不是取代臨床即時查閱)。
- 複訓改「短時、高頻」的間隔設計;考題往「費力提取」靠:簡答、口頭申論優於再認。
- 事先向學員說明原理與可預期的「短期表現下降」——有效的不是疲勞感本身,而是對準學習目標的費力提取與生成;滿意度短期下降是可預期的(記得郵務員實驗),事先溝通是合理的因應。
AI 工具導入
- 在教學與練習情境立規則「先自己寫,再問 AI」(練習用病歷、鑑別、處置計畫皆然);真實病人照護中若時效與病安要求即時查證,不適用此摩擦。
- 把「批判 AI 輸出」變成作業本身——找出它的錯誤、補上它沒問的問題。
- 自我校準用「延遲、不看答案」的自測:延遲後只看題幹自問「我答得出來嗎」的判斷最準確(Dunlosky 與 Nelson 1992,見 Bjork 1994 所引)。
- 教師的新任務是決定哪個環節保留人為掙扎、哪個環節放心外包(教育科技評論圈稱之為 friction architect,屬評論用語而非實證術語)。
捌常見誤用
- 把「加摩擦」做成「把介面做爛、把說明寫模糊」——那是 extraneous load,Cooper 原義的摩擦,該刪。
- 把掙扎丟給毫無先備知識的純新手而不給鷹架——那叫 unproductive failure,不是教學法。
- 只有生成、沒有收攏——「學生解法 vs 正解」的對照講解被視為 PF 促成學習的關鍵階段,少了後半段就不是完整的 PF 設計,只是挫折。
- 用當下表現評估教學成效——短期表現亮眼恰恰可能是 unproductive success;學習要在延遲後測。
- 把「學員滿意度下降」當成教法失敗的證據——有益的困難常伴隨滿意度短期下降,需要事先溝通與長期成果佐證(但也別反過來把「大家都在抱怨」一律當成教法有效的勳章)。
- 把 cognitive friction 當成有既定操作型定義的實證術語引用——它是設計語彙,引證據時請回到 desirable difficulties/productive failure/testing effect 的原始文獻。
玖證據速查表:可說/不能說
| 來源 | 類型 | 可說 | 不能說 |
Bjork 1994;Bjork & Bjork 2020 理論+實驗回顧 | Desirable difficulties 原典與更新 | 五類困難操弄在多數實驗中損短期表現、利長期保留與遷移;流暢感是不可靠的學習指標 | 任何困難都有益(困難須是學習者有能力回應的);已在臨床教育證實改善臨床表現 |
Sinha & Kapur 2021 統合分析 | 53 篇、166 組比較 | PS-I 優於 I-PS(g 0.36,高擬真 0.37–0.58),利概念理解與遷移 | 程序知識也變好(未檢出差異);適用於年幼學習者與領域一般技能(該處效應反轉) |
BEME Guide No. 48(2018) 系統性回顧 | 健康專業教育 TEL,19 篇 | 多數保留/遷移成果方向有利於測驗式學習,含模擬與標準化病人形式 | 每個結果都顯著;有合併效應量(異質性使其未進行);改善病人結果 |
Kerfoot 2007 RCT | 醫學生 spaced education | 每週 email 間隔提取顯著改善年終測驗(P<0.001),遠期分組效應量最大達 d 1.01 | 間隔介入普遍「越遠期效果越強」的通則(單校單科) |
Fan 2025 實驗 | 117 人四組,英文寫作 | ChatGPT 組成品改善最佳、知識獲得與遷移未檢出差異;SRL 歷程改變,作者提出「後設認知怠惰」的解釋 | 已證明 AI 造成後設認知怠惰;可直接外推到臨床學習 |
Maguire 2000/2006 橫斷面 | 計程車/公車司機海馬迴 | 導航經驗與海馬迴灰質差異相關,與經驗依賴可塑性一致 | 橫斷面研究已證明「訓練改變大腦」的因果 |
Hiebert & Grouws 2007;Cooper 1999 二手引述 | 詞源 | productive struggle 出自數學教育、cognitive friction 出自 UX 且原為負面詞 | (本文未直接取得原文全文,措辭細節以原著為準) |
拾參考文獻
- Bjork RA. Memory and metamemory considerations in the training of human beings. In: Metcalfe J, Shimamura AP, eds. Metacognition: Knowing about Knowing. MIT Press; 1994:185–205.
- Bjork RA, Bjork EL. Desirable difficulties in theory and practice. J Appl Res Mem Cogn. 2020;9(4):475–479.
- Kapur M. Examining productive failure, productive success, unproductive failure, and unproductive success in learning. Educ Psychol. 2016;51(2):289–299. doi:10.1080/00461520.2016.1155457
- Sinha T, Kapur M. When problem solving followed by instruction works: evidence for productive failure. Rev Educ Res. 2021;91(5):761–798. doi:10.3102/00346543211019105
- Hiebert J, Grouws DA. The effects of classroom mathematics teaching on students' learning. In: Lester FK, ed. Second Handbook of Research on Mathematics Teaching and Learning. Information Age; 2007:371–404.
- Larsen DP, Butler AC, Roediger HL III. Test-enhanced learning in medical education. Med Educ. 2008;42(10):959–966. doi:10.1111/j.1365-2923.2008.03124.x
- Green ML, Moeller JJ, Spak JM. Test-enhanced learning in health professions education: a systematic review: BEME Guide No. 48. Med Teach. 2018;40(4):337–350. doi:10.1080/0142159X.2018.1430354
- Kerfoot BP, DeWolf WC, Masser BA, Church PA, Federman DD. Spaced education improves the retention of clinical knowledge by medical students: a randomised controlled trial. Med Educ. 2007;41(1):23–31. doi:10.1111/j.1365-2929.2006.02644.x
- Cheng A, et al. Resuscitation education science: educational strategies to improve outcomes from cardiac arrest: a scientific statement from the American Heart Association. Circulation. 2018. doi:10.1161/CIR.0000000000000583
- Fan Y, Tang L, Le H, et al. Beware of metacognitive laziness: effects of generative artificial intelligence on learning motivation, processes, and performance. Br J Educ Technol. 2025;56(2):489–530. doi:10.1111/bjet.13544
- Maguire EA, Gadian DG, Johnsrude IS, et al. Navigation-related structural change in the hippocampi of taxi drivers. Proc Natl Acad Sci USA. 2000;97(8):4398–4403. doi:10.1073/pnas.070039597
- Maguire EA, Woollett K, Spiers HJ. London taxi drivers and bus drivers: a structural MRI and neuropsychological analysis. Hippocampus. 2006;16(12):1091–1101. doi:10.1002/hipo.20233
- Cooper A. The Inmates Are Running the Asylum: Why High-Tech Products Drive Us Crazy and How to Restore the Sanity. Sams; 1999.
- Hodges B. Raising the Stakes: The Power and Potential of Examination for Learning. 開幕 plenary,The AMEE Conference 2026(Featuring the Integrated Ottawa Event),Vienna,2026 年 8 月。AMEE 官方場次公告(內容依現場投影片與聽講筆記整理,非逐字稿)
使用聲明
本文為醫學教育方法學之教學整理,供臨床教師備課與帶教參考,非官方教學規範或臨床指引。文中數字與主張均回對原始文獻,並逐處標明證據強度與適用邊界(見「證據定位」與「證據速查表」);證據持續更新,實際教學設計與臨床決策請依最新原始文獻、所在機構規範與個別情境判斷。任何「摩擦設計」僅適用於教學與練習情境,不得影響真實病人照護的即時性與安全。