Learning Sciences · 認知科學讀本

建設性掙扎與認知摩擦:
AI 時代,把困難設計回學習裡

對象:臨床教師與醫學教育工作者(含急診)。緣起:AMEE 2026 開幕 plenary(Brian Hodges)投影片上的一組配對——「Productive Struggle: Cognitive Friction」。
掃描開啟本頁
本文的證據定位(請先讀這一句) 本文的實證支柱是 desirable difficulties(實驗心理學傳統,多為實驗室與教室研究)、productive failure(統合分析多來自中小學與大學的數理領域)、以及醫學教育內的測驗式學習與間隔學習。「cognitive friction」與「productive struggle」這兩個詞本身都不是有標準化定義的醫學教育實證術語;「摩擦設計改善臨床能力或病人結果」在本文檢視的文獻範圍內尚未見直接證據。文中的臨床落地清單屬「證據知情(evidence-informed)」的原則外推,效果需在各自場域驗證,且任何摩擦設計都以不影響真實病人照護安全為前提。全文逐處標明證據強度,文末附證據速查表。

一句話定位:productive struggle(建設性掙扎)是學習者端的歷程——教育者想讓學習者經歷的狀態;cognitive friction(認知摩擦)是環境端的設計手段——刻意放進學習流程裡的阻力。摩擦是劑量,掙扎是反應,學習是療效;而且和藥一樣,有治療窗、有毒性、有禁忌症。

壹起點:AMEE 2026 開幕演講的一行字

AMEE 2026(維也納)開幕 plenary 上,Brian Hodges(University of Toronto)以「Raising the Stakes: The Power and Potential of Examination for Learning」為題,列出六項「實證的、友善學習的科技」。每一項都是「學習科學原則:科技載體」的配對,其中第五項寫著——

Productive Struggle: Cognitive FrictionAMEE 2026 開幕 plenary 投影片第五項(依現場投影片轉錄)

整場演講的敘事是:當知識從大腦搬到雲端、再走向 AI 輔助推理,「記得多少」不再是能力的代理指標;但同一場演講也警告,AI 讓學習的預設值變成「毫無阻力」,而學習科學數十年的證據恰恰指向相反的方向——能力是從適度的困難裡長出來的。Hodges 引用的開場故事是著名的倫敦計程車司機研究:通過 The Knowledge 考試(依演講轉述,須熟記約 2.5 萬條街道)的司機,其空間記憶相關的海馬迴結構與對照組不同,且後海馬迴灰質與駕駛年資相關;行駛固定路線的公車司機則無此發現橫斷面——長期導航經驗與海馬迴結構差異相關,與「經驗驅動可塑性」的解釋一致(橫斷面研究不能確立因果,但方向發人深省)。

這一頁投影片把兩個出身完全不同的詞焊在一起。要正確使用它們,得先把各自的來歷說清楚。

貳先把兩個詞說清楚

Productive struggle(建設性掙扎)——教育研究的老概念

出自教育研究。Hiebert 與 Grouws(2007)在數學教育研究手冊中,把「讓學生有機會掙扎」列為促進概念理解的關鍵教學特徵之一:努力去搞懂當下還不明白的東西——並明確劃界,掙扎應落在學生能力可及的範圍,不是無謂的挫折(本條為二手引述,原章未直接取得全文)。原始價值判斷是正面的:掙扎是概念學習的必要成分。

同族概念:desirable difficulties(Bjork,見第參節)、productive failure(Kapur,見第肆節)、以及 Vygotsky 的近側發展區(ZPD)與鷹架(scaffolding)。

Cognitive friction(認知摩擦)——出身 UX、原本是個負面詞

出自互動設計。Alan Cooper 在《The Inmates Are Running the Asylum》(1999)造出此詞,指人與「規則隨情境改變的複雜系統」互動時遭遇的智識阻力(例:微波爐同一組數字鍵在不同模式下代表火力或時間)。在 UX 傳統裡,摩擦是設計缺陷、應該被消除(本條亦為二手引述)。

2024–2026 年的 AI 教育論述把它「翻轉」成正面設計語彙:既然生成式 AI 把學習流程變得毫無阻力,教育者就要刻意把摩擦設計回去(所謂 friction architect——評論用語,非實證術語)。它至今不是有成熟實證定義的教育學術語;其正當性必須錨定在 productive struggle 這一側的實證傳統上。

兩者的關係,投影片的句法已經講完:摩擦是輸入,掙扎是反應;掙扎是目的,摩擦是工程。Hodges 把 cognitive friction 放在「科技」欄位的意義在於——在 AI 時代,摩擦本身成了一種需要刻意配置的教育設計元素,而它的劑量學,來自下面兩節的老證據。

參理論底層(Bjork):學習不等於表現

1994 年,UCLA 心理學家 Robert Bjork 在一篇經典章節中提出「desirable difficulties(有益的困難)」:許多加速訓練中表現進步的操弄,無助於長期的訓練後表現;反之,許多看似替學習者製造困難的操弄,反而增強長期保留與遷移。理論核心是「學習 ≠ 表現」:表現(performance)當下可測,學習(learning)只能在延遲後間接測得。Bjork 與 Bjork(2020)用「儲存強度/提取強度」的框架進一步說明:當下提取強度越高(越流暢),重讀或再提取帶來的儲存強度增益越小——所以「遺忘(提取強度下降)反而能促成學習」,這正是間隔與變化有效的機轉。

原典中的五類「有益的困難」

操弄訓練中的表現長期保留/遷移代表證據(皆見 Bjork 1994 所引)
變化練習條件(隨機排程、參數變動)變差變好Shea & Morgan 1979(隨機勝過分塊,連「分塊型測驗」都是隨機組贏);Kerr & Booth 1978(丟沙包練 2 與 4 呎,測 3 呎時勝過只練 3 呎的組)
情境干擾/交錯變差變好Mannes & Kintsch 1987(不一致大綱使逐字回憶較差,但推論與解題較好)
間隔練習變差變好Bahrick 1979:三次訓練以 30 天間隔,30 天後保留 72%;同日集中與間隔 1 天分別只有 33% 與 64%
減少回饋頻率變差變好Schmidt 等(摘要式、漸減式回饋損害習得、利於長期保留)
把測驗當學習事件變差變好Hogan & Kintsch 1971(讀書組贏在當下、測驗組贏在 48 小時後);Landauer & Bjork 1978(擴增式提取練習)

為什麼沒人想用:流暢感的三重陷阱

「進行任何實質的學習時,令人不安的應該是錯誤與困難的缺席,而不是它們的出現。」Robert A. Bjork, 1994(中譯;原文:…we should probably find the absence, not the presence, of errors, mistakes, and difficulties to be distressing…)
困難要成為「有益的」,是有前提的(Bjork & Bjork 2020):學習者必須具備成功回應該困難的背景知識與技能;否則它就是單純的(undesirable)困難。最適難度隨先備學習程度而變——這正是「掙扎要落在能力邊緣」的理論版本。

肆把掙扎做成設計:productive failure(Kapur)

如果 Bjork 回答「哪些困難有益」,新加坡/蘇黎世聯邦理工的 Manu Kapur 則回答「怎麼把掙扎排進課程」。他利用「學習與表現不可通約」把教學設計切成 2×2(Kapur 2016)框架論文:

短期表現好短期表現差
長期學習好Productive success——鷹架充分的問題導向學習(PBL、引導式探究)Productive failure——先讓學生解「還沒教過」的問題(通常會失敗),再以教學收攏
長期學習差Unproductive success——反覆操練與死背:表現亮眼、理解沒跟上,是「學習的假象」。Kapur 論證:相對於 PF/PS,連傳統直接教學都可能落在這格Unproductive failure——毫無引導的純發現式學習(兩派學者難得共識地反對)

Productive failure 的兩階段:先「生成」(讓學生用先備知識產出多個次佳、甚至錯誤的解法),後「收攏」(教師把學生解法與正解對照比較,指出關鍵特徵)。機轉有三:活化並分化先備知識;讓學生意識到自己知識的缺口;以及在對照中更深地編碼新概念的關鍵特徵。有趣的是,Kapur(2011)與 Loibl 與 Rummel(2013)都發現:在生成階段給予引導確實讓學生「解對」了,但事後學習並沒有更好——初期的解題成功本身不是重點,被活化的先備知識與被暴露的缺口才是。

統合分析量級(Sinha 與 Kapur 2021;53 篇研究、166 組比較):「先解題後教學(PS-I)」整體優於「先教學後解題(I-PS)」,Hedges' g 0.36(95% CI 0.20–0.51);依 PF 設計準則高擬真執行時 g 0.37–0.58;校正發表偏差後的真實效應估計更高(g 0.87)。收益集中在概念理解與遷移;程序知識則未檢出顯著差異(信賴區間仍容許小幅利弊,長期流暢度亦未被充分評估)。所謂高擬真,指問題能引出多元解法與表徵、有情感吸引力(真實情境、對比案例)、有小組與社會支持,且教學階段連結學生生成的解法(統合分析中與較大效應量相關的 fidelity 準則之一)——不是把學生丟進困難就叫 productive failure。

適用邊界(同一篇統合分析):年幼學習者(約小二至小五)與「領域一般技能」的效應反轉、偏向先教學。把掙扎設計用在成人、領域特定知識(如醫學教育)較符合證據所在的範圍;對全新領域的純新手,先給結構仍是合理預設。

與醫學教育的直接關聯:Kapur 歸類為 productive success 的 PBL,其統合分析大多來自醫學生——Vernon 與 Blake(1993)發現直接教學利於基礎知識、PBL 利於臨床應用;Dochy 等(2003)更發現直接教學在基礎知識上的優勢,到醫學院二年級之後就消失了;Schmidt 等(2009)彙整 270 組比較,PBL 在知識與診斷推理有小幅正效應、在臨床技能效應更強(皆見 Kapur 2016 所引)。換句話說,醫學教育其實早就在大規模使用「有鷹架的掙扎」。

伍你已經在用的摩擦:測驗與間隔

回頭看那頁投影片的第一、三項——「持續低風險測驗」與「間隔重複練習」——它們本身就是 Bjork 清單上的兩種經典有益困難。也就是說,第五項(認知摩擦)是第一、三項的上位原則;而這兩項是醫學教育裡研究累積最多的摩擦:

把六項讀成一個系統:低風險持續測驗與間隔練習(#1、#3)是摩擦的具體形式;鷹架與 progress testing(#2)把摩擦維持在可承受區間並畫出成長曲線;learning analytics(#4)幫你調劑量;後設認知與批判性反思(#6)是學習者對自身掙扎的監控迴路。它們不是六個並列的 buzzword,是一部咬合的機器。(此為本文對投影片結構的詮釋。)

陸AI 把摩擦變成稀缺品

在生成式 AI 之前,摩擦是學習流程的預設值:查書、手算、自己寫草稿。教學建議只需要「忍住,不要把困難移除」。生成式 AI 把預設值改成毫無阻力——答案即時、成品即得,掙扎不再自然發生。於是有益的困難從「本來就在」變成「必須刻意設計回去」。

實驗實證警訊已經出現。Fan 等(2025)把 117 名大學生隨機分為四組完成同一份英文閱讀寫作任務:無支援、ChatGPT、真人專家、寫作分析工具。結果:ChatGPT 組的作文改善分數顯著最高(p=0.005;比其他三組各多約 2 分),但知識獲得(p=0.438)與知識遷移(p=0.996)皆未檢出組間顯著差異——無差異不等於證明相等,但「AI 讓成品變好」至少沒有同步反映在知識測驗上;內在動機亦無組間差異,自我調節學習歷程卻顯著不同:AI 組的評估、定向等後設認知活動較少、學習歷程繞著 ChatGPT 打轉。作者將此解釋為可能的「後設認知怠惰(metacognitive laziness)」——把後設認知負荷卸載給 AI 的傾向,尚待更多場域驗證。

這就是「認知摩擦」在 AI 時代被翻轉成正面詞的原因。但要用對,得分清楚好摩擦與壞摩擦:

值得設計的摩擦(認知性阻力) 迫使學習者提取、生成、比較、批判——增加的是基模建構的努力(認知負荷理論所稱 germane load)。例:先作答再看解析;先寫下判斷再問 AI;要求批判 AI 輸出、找出錯誤;延遲回饋;交錯病例。判準:阻力落在學習目標本身,且學習者具備回應它的先備能力。
仍然該消除的摩擦(操作性阻力) 介面難用、指令不清、流程冗贅——Cooper 1999 原義的摩擦(extraneous load)。例:難找的按鈕、反覆登入、模糊的作業說明、為難而難的題目。判準:阻力落在與學習目標無關的雜訊。
「加摩擦」不是「把課變難」的通行證。劑量學三原則:①落點在能力邊緣(太易=無效劑量;太難無支持=毒性:挫折、放棄、習得無助);②有鷹架與心理安全承接(Kapur 的收攏階段、Vygotsky 的 ZPD);③學習者要能把掙扎詮釋為「正在變強」——同樣的劑量,詮釋不同,反應就不同(此第③點為成長心態文獻的原則性延伸,非本文引用研究的直接發現)。

柒臨床教學的落地清單(證據知情的外推)

床邊與模擬

課程與在職教育

AI 工具導入

捌常見誤用

  1. 把「加摩擦」做成「把介面做爛、把說明寫模糊」——那是 extraneous load,Cooper 原義的摩擦,該刪。
  2. 把掙扎丟給毫無先備知識的純新手而不給鷹架——那叫 unproductive failure,不是教學法。
  3. 只有生成、沒有收攏——「學生解法 vs 正解」的對照講解被視為 PF 促成學習的關鍵階段,少了後半段就不是完整的 PF 設計,只是挫折。
  4. 用當下表現評估教學成效——短期表現亮眼恰恰可能是 unproductive success;學習要在延遲後測。
  5. 把「學員滿意度下降」當成教法失敗的證據——有益的困難常伴隨滿意度短期下降,需要事先溝通與長期成果佐證(但也別反過來把「大家都在抱怨」一律當成教法有效的勳章)。
  6. 把 cognitive friction 當成有既定操作型定義的實證術語引用——它是設計語彙,引證據時請回到 desirable difficulties/productive failure/testing effect 的原始文獻。

玖證據速查表:可說/不能說

來源類型可說不能說
Bjork 1994;Bjork & Bjork 2020
理論+實驗回顧
Desirable difficulties 原典與更新五類困難操弄在多數實驗中損短期表現、利長期保留與遷移;流暢感是不可靠的學習指標任何困難都有益(困難須是學習者有能力回應的);已在臨床教育證實改善臨床表現
Sinha & Kapur 2021
統合分析
53 篇、166 組比較PS-I 優於 I-PS(g 0.36,高擬真 0.37–0.58),利概念理解與遷移程序知識也變好(未檢出差異);適用於年幼學習者與領域一般技能(該處效應反轉)
BEME Guide No. 48(2018)
系統性回顧
健康專業教育 TEL,19 篇多數保留/遷移成果方向有利於測驗式學習,含模擬與標準化病人形式每個結果都顯著;有合併效應量(異質性使其未進行);改善病人結果
Kerfoot 2007
RCT
醫學生 spaced education每週 email 間隔提取顯著改善年終測驗(P<0.001),遠期分組效應量最大達 d 1.01間隔介入普遍「越遠期效果越強」的通則(單校單科)
Fan 2025
實驗
117 人四組,英文寫作ChatGPT 組成品改善最佳、知識獲得與遷移未檢出差異;SRL 歷程改變,作者提出「後設認知怠惰」的解釋已證明 AI 造成後設認知怠惰;可直接外推到臨床學習
Maguire 2000/2006
橫斷面
計程車/公車司機海馬迴導航經驗與海馬迴灰質差異相關,與經驗依賴可塑性一致橫斷面研究已證明「訓練改變大腦」的因果
Hiebert & Grouws 2007;Cooper 1999
二手引述
詞源productive struggle 出自數學教育、cognitive friction 出自 UX 且原為負面詞(本文未直接取得原文全文,措辭細節以原著為準)

拾參考文獻

  1. Bjork RA. Memory and metamemory considerations in the training of human beings. In: Metcalfe J, Shimamura AP, eds. Metacognition: Knowing about Knowing. MIT Press; 1994:185–205.
  2. Bjork RA, Bjork EL. Desirable difficulties in theory and practice. J Appl Res Mem Cogn. 2020;9(4):475–479.
  3. Kapur M. Examining productive failure, productive success, unproductive failure, and unproductive success in learning. Educ Psychol. 2016;51(2):289–299. doi:10.1080/00461520.2016.1155457
  4. Sinha T, Kapur M. When problem solving followed by instruction works: evidence for productive failure. Rev Educ Res. 2021;91(5):761–798. doi:10.3102/00346543211019105
  5. Hiebert J, Grouws DA. The effects of classroom mathematics teaching on students' learning. In: Lester FK, ed. Second Handbook of Research on Mathematics Teaching and Learning. Information Age; 2007:371–404.
  6. Larsen DP, Butler AC, Roediger HL III. Test-enhanced learning in medical education. Med Educ. 2008;42(10):959–966. doi:10.1111/j.1365-2923.2008.03124.x
  7. Green ML, Moeller JJ, Spak JM. Test-enhanced learning in health professions education: a systematic review: BEME Guide No. 48. Med Teach. 2018;40(4):337–350. doi:10.1080/0142159X.2018.1430354
  8. Kerfoot BP, DeWolf WC, Masser BA, Church PA, Federman DD. Spaced education improves the retention of clinical knowledge by medical students: a randomised controlled trial. Med Educ. 2007;41(1):23–31. doi:10.1111/j.1365-2929.2006.02644.x
  9. Cheng A, et al. Resuscitation education science: educational strategies to improve outcomes from cardiac arrest: a scientific statement from the American Heart Association. Circulation. 2018. doi:10.1161/CIR.0000000000000583
  10. Fan Y, Tang L, Le H, et al. Beware of metacognitive laziness: effects of generative artificial intelligence on learning motivation, processes, and performance. Br J Educ Technol. 2025;56(2):489–530. doi:10.1111/bjet.13544
  11. Maguire EA, Gadian DG, Johnsrude IS, et al. Navigation-related structural change in the hippocampi of taxi drivers. Proc Natl Acad Sci USA. 2000;97(8):4398–4403. doi:10.1073/pnas.070039597
  12. Maguire EA, Woollett K, Spiers HJ. London taxi drivers and bus drivers: a structural MRI and neuropsychological analysis. Hippocampus. 2006;16(12):1091–1101. doi:10.1002/hipo.20233
  13. Cooper A. The Inmates Are Running the Asylum: Why High-Tech Products Drive Us Crazy and How to Restore the Sanity. Sams; 1999.
  14. Hodges B. Raising the Stakes: The Power and Potential of Examination for Learning. 開幕 plenary,The AMEE Conference 2026(Featuring the Integrated Ottawa Event),Vienna,2026 年 8 月。AMEE 官方場次公告(內容依現場投影片與聽講筆記整理,非逐字稿)
使用聲明

本文為醫學教育方法學之教學整理,供臨床教師備課與帶教參考,非官方教學規範或臨床指引。文中數字與主張均回對原始文獻,並逐處標明證據強度與適用邊界(見「證據定位」與「證據速查表」);證據持續更新,實際教學設計與臨床決策請依最新原始文獻、所在機構規範與個別情境判斷。任何「摩擦設計」僅適用於教學與練習情境,不得影響真實病人照護的即時性與安全。