Versant聽/說測驗白皮書
2026.05.19VERSANT ENGLISH SPEAKING & LISTENING TEST
口語流暢度,可以被穩定量測。
這份白皮書,說明它如何做到。
Versant 英語口說與聽力測驗以約二十分鐘的作答,評量十五歲以上考生理解與口說英語的能力,分數對應全球英語量表(GSE,10–90)與歐洲共同語言參考架構(CEFR)——以下摘要其官方白皮書的測驗設計、計分方法與效度驗證。
簡介
Versant 英語口說與聽力測驗是一項評量個人理解與口說英語能力的工具,適用於十五歲以上的成人與學生,作答約需二十分鐘。測驗結果可提供可靠的資訊,應用於分班與資格認定決策,並可追蹤進度、衡量教學成果。分數透過全球英語量表(GSE,介於 10 到 90 分)以及歐洲共同語言參考架構(CEFR)進行報告。
測驗說明
測驗設計與施測
測驗可透過手機應用程式或電腦隨時隨地進行。施測時,系統以會話語速播放一系列錄音提示,並引導考生以英語口頭回答;提示語音由來自美國、英國與澳洲的母語人士錄製。測驗從大型題庫中隨機抽取約 37 題,分為六個部分。測驗指令由單一配音員播報,並逐字顯示於螢幕上,以確保考生理解。
六個部分的題型
錄製語音樣本Recorded Voice Sample
考生聽取問題後有最高 30 秒時間回答。此部分不計分,僅用於收集自發性語音樣本,供授權人員檢閱。
A|簡短回答(約 8 題)Part A · Short Answer
以單字或短語回答問題,內容涵蓋時間、順序、數量或基本邏輯的簡單推論,不預設特定領域背景知識。
B|句子複誦(約 16 題)Part B · Sentence Repeat
聽取 5 到 15 個單字的句子後逐字複誦。習慣以有意義的意群(chunk)處理詞彙者,能複誦較長的句子。
C|對話問答(約 6 題)Part C · Conversations
聽取兩人之間約三回合的對話後,回答一個理解問題,需具備快速的詞彙識別與意義解碼能力。
D|短文問答(約 6 題)Part D · Passage Comprehension
聽取一段 50 到 150 字的短文(通常為敘事),隨後回答三個理解問題,包含主旨與細節。
E|短文複述(約 2–3 題)Part E · Passage Retelling
聽取一段短文後,有 30 秒時間用自己的話複述,評量流暢度、發音、理解力、詞彙與複述的準確度。
F|表達意見(約 2–3 題)Part F · Open Questions
聽取問題後有 40 秒時間作答並給予解釋,測量以正確文法與詞彙流暢建構連貫語句的能力。
測驗核心能力:英語口語流暢度
測驗核心能力定義為「英語口語流暢度(Facility in spoken English)」,即理解日常主題的口語英語,並以平順的會話語速與清晰的英語給出適切回應的能力。這對應日常對話的實況:人必須在維持會話語速的同時,追蹤說話內容、擷取意義,然後構思並產出相關的回應。
在日常對話中,英語母語人士從建構子句結構到語音編碼約需 40 毫秒,而日常對話輪替(turn taking)的典型時間視窗約為 500 到 1000 毫秒。若語言使用者無法在如此短的時間內完成聽與說,便難以有效溝通。
題目普遍設計得簡短,考生不需要理解大量脈絡(context-independent)即能作答。此設計有三個原因:
- 測量最基本的單字與短語意義。
- 減少世界知識與認知風格的干擾,使表現更貼近語言能力本身。
- 最大化作答密度,減少建立背景認知的時間,把時間留給語言評量數據的蒐集。
內容設計與開發
測驗內容設計為跨區域中立。大部分詞彙選自 Switchboard 語料庫中最常用的 8,000 個單字。題目由具備語言學進階學位的專家撰寫,並經外部語言學家審核,確保符合不同地區的口語習慣,且無歧視或偏見。為保留於測驗中,每道題目必須有至少 90% 的母語參考樣本能理解並正確作答。
分數報告與計算
分數於全球英語量表(GSE,範圍 10–90)及對應的 CEFR 上進行報告,並由三個診斷次分數組成。
總分Overall
由三個診斷次分數加權組成,代表理解口語英語,並以會話語速清晰表達的能力。
聽力(佔 50%)Listening
反映從會話語速的英語語音中追蹤意義、推斷訊息的能力。
口說(佔 50%)Speaking
由「說話方式(25%)」與「語言使用與內容(25%)」組成,透過物理聲學特徵測量發音、流暢度與清晰度。
測驗採用針對非母語口音優化的自動語音辨識系統。短答與句子複誦依據預期單字的存在與順序計分;短文複述與表達意見則透過潛在語意分析(Latent Semantic Analysis)的變體技術,比對預期單字與序列的權重評分。分數以 Rasch 項目反應理論(IRT)模型校準,並使用 EAP(expected a posteriori)演算法計算;再透過專家小組評估 200 位考生的表現進行標準設定,將 IRT 分數轉換並對應至 GSE 與 CEFR 量表。
效度驗證
驗證樣本
樣本包含 260 位成人(123 名男性、135 名女性、2 名非二元性別)。其中 26 位為英語母語人士,234 位為英語語言學習者(ELL),涵蓋 30 種不同的母語背景,如阿拉伯語、日語、中文、西班牙語等。
內部效度
折半信度Split-half Reliability
機評的總分信度為 .96,人類專家評分的總分信度亦為 .96,顯示機評對信度的影響極小,測驗能提供高度一致的分數。
次分數相關性Sub-score Correlation
各次分數間高度相關(口說與聽力 .82、說話方式與聽力 .85),但未達完全相關(1.0),顯示次分數確實測量到語言能力的不同面向。
機評與人評之比較Machine vs. Human Scoring
同一批錄音下,機評與人評高度相關(總分 .96、聽力 .95、口說 .96),顯示機器評分與仔細的人類評分幾乎無法區分。
與已知母體的關係
驗證測驗能否反映母語人士與英語學習者間的預期差異。結果顯示,26 位母語人士的平均總分為 87.48 分,且無人低於 70 分;234 位英語學習者的分數則廣泛分布,平均為 61.26 分,僅 36% 高於 70 分。累積密度函數(CDF)圖表顯示,總分能有效區分母語與非母語群體。
與 CEFR 的關聯
透過以題目為中心(item-centered)與以考生為中心(candidate-centered)兩種獨立方法,將測驗分數對應至 CEFR 等級,兩者估計值高度一致(r=.99)。對應標準如下:
| CEFR 等級 | Versant 分數區間 |
|---|---|
| A1 | 22 – 29 分 |
| A2 | 30 – 35 分 |
| B1 | 43 – 50 分 |
| B2 | 59 – 66 分 |
| C1 | 76 – 84 分 |
| C2 | 85 – 90 分 |
結論
驗證研究的資料支持以下結論:
精確可靠的技能估計Precision
測驗能產生精確且可靠的技能估計值。
有效區分母語與學習者Group Separation
總分能有效區分第一語言為英語者與英語語言學習者。
具診斷價值的次分數Diagnostic Value
次分數具合理區別度,能提供各項技能的診斷資訊。
機評貼近人評Scoring Consistency
機器評分與人類評分具有極高的相關性。
符合 EEOC 準則EEOC Compliance
驗證數據符合美國平等就業機會委員會(EEOC)針對人員甄選程序中,關於測驗可靠性與效度的準則要求。
想進一步了解 Versant 口說與聽力測驗
歡迎與我們聯繫,顧問將依貴公司的情境提供說明。