VERSANT ENGLISH SPEAKING & LISTENING TEST

口語流暢度,可以被穩定量測。
這份白皮書,說明它如何做到。

Versant 英語口說與聽力測驗以約二十分鐘的作答,評量十五歲以上考生理解與口說英語的能力,分數對應全球英語量表(GSE,10–90)與歐洲共同語言參考架構(CEFR)——以下摘要其官方白皮書的測驗設計、計分方法與效度驗證。

20分鐘手機或電腦,隨時作答
GSE 10–90對應 CEFR 六級量表
.96機評與人評總分相關係數
260效度驗證考生樣本
01INTRODUCTION

簡介

Versant 英語口說與聽力測驗是一項評量個人理解與口說英語能力的工具,適用於十五歲以上的成人與學生,作答約需二十分鐘。測驗結果可提供可靠的資訊,應用於分班與資格認定決策,並可追蹤進度、衡量教學成果。分數透過全球英語量表(GSE,介於 10 到 90 分)以及歐洲共同語言參考架構(CEFR)進行報告。

02TEST DESCRIPTION

測驗說明

測驗設計與施測

測驗可透過手機應用程式或電腦隨時隨地進行。施測時,系統以會話語速播放一系列錄音提示,並引導考生以英語口頭回答;提示語音由來自美國、英國與澳洲的母語人士錄製。測驗從大型題庫中隨機抽取約 37 題,分為六個部分。測驗指令由單一配音員播報,並逐字顯示於螢幕上,以確保考生理解。

六個部分的題型

錄製語音樣本Recorded Voice Sample

考生聽取問題後有最高 30 秒時間回答。此部分不計分,僅用於收集自發性語音樣本,供授權人員檢閱。

A|簡短回答(約 8 題)Part A · Short Answer

以單字或短語回答問題,內容涵蓋時間、順序、數量或基本邏輯的簡單推論,不預設特定領域背景知識。

B|句子複誦(約 16 題)Part B · Sentence Repeat

聽取 5 到 15 個單字的句子後逐字複誦。習慣以有意義的意群(chunk)處理詞彙者,能複誦較長的句子。

C|對話問答(約 6 題)Part C · Conversations

聽取兩人之間約三回合的對話後,回答一個理解問題,需具備快速的詞彙識別與意義解碼能力。

D|短文問答(約 6 題)Part D · Passage Comprehension

聽取一段 50 到 150 字的短文(通常為敘事),隨後回答三個理解問題,包含主旨與細節。

E|短文複述(約 2–3 題)Part E · Passage Retelling

聽取一段短文後,有 30 秒時間用自己的話複述,評量流暢度、發音、理解力、詞彙與複述的準確度。

F|表達意見(約 2–3 題)Part F · Open Questions

聽取問題後有 40 秒時間作答並給予解釋,測量以正確文法與詞彙流暢建構連貫語句的能力。

測驗核心能力:英語口語流暢度

測驗核心能力定義為「英語口語流暢度(Facility in spoken English)」,即理解日常主題的口語英語,並以平順的會話語速與清晰的英語給出適切回應的能力。這對應日常對話的實況:人必須在維持會話語速的同時,追蹤說話內容、擷取意義,然後構思並產出相關的回應。

在日常對話中,英語母語人士從建構子句結構到語音編碼約需 40 毫秒,而日常對話輪替(turn taking)的典型時間視窗約為 500 到 1000 毫秒。若語言使用者無法在如此短的時間內完成聽與說,便難以有效溝通。

關於自動化(automaticity)評量的心理語言學說明此評量可能被誤解為記憶力測驗。然而心理語言學研究顯示,用於記憶數字串的口語工作記憶,與用於處理和理解句子的認知資源截然不同。若測量的是記憶力,母語人士的分數應隨記憶力差異產生較大變異;但實證顯示,母語人士皆獲得極高分。

題目普遍設計得簡短,考生不需要理解大量脈絡(context-independent)即能作答。此設計有三個原因:

  1. 測量最基本的單字與短語意義。
  2. 減少世界知識與認知風格的干擾,使表現更貼近語言能力本身。
  3. 最大化作答密度,減少建立背景認知的時間,把時間留給語言評量數據的蒐集。
03CONTENT DESIGN & DEVELOPMENT

內容設計與開發

測驗內容設計為跨區域中立。大部分詞彙選自 Switchboard 語料庫中最常用的 8,000 個單字。題目由具備語言學進階學位的專家撰寫,並經外部語言學家審核,確保符合不同地區的口語習慣,且無歧視或偏見。為保留於測驗中,每道題目必須有至少 90% 的母語參考樣本能理解並正確作答。

04SCORE REPORTING & SCALING

分數報告與計算

分數於全球英語量表(GSE,範圍 10–90)及對應的 CEFR 上進行報告,並由三個診斷次分數組成。

總分Overall

由三個診斷次分數加權組成,代表理解口語英語,並以會話語速清晰表達的能力。

聽力(佔 50%)Listening

反映從會話語速的英語語音中追蹤意義、推斷訊息的能力。

口說(佔 50%)Speaking

由「說話方式(25%)」與「語言使用與內容(25%)」組成,透過物理聲學特徵測量發音、流暢度與清晰度。

測驗採用針對非母語口音優化的自動語音辨識系統。短答與句子複誦依據預期單字的存在與順序計分;短文複述與表達意見則透過潛在語意分析(Latent Semantic Analysis)的變體技術,比對預期單字與序列的權重評分。分數以 Rasch 項目反應理論(IRT)模型校準,並使用 EAP(expected a posteriori)演算法計算;再透過專家小組評估 200 位考生的表現進行標準設定,將 IRT 分數轉換並對應至 GSE 與 CEFR 量表。

05VALIDATION

效度驗證

驗證樣本

樣本包含 260 位成人(123 名男性、135 名女性、2 名非二元性別)。其中 26 位為英語母語人士,234 位為英語語言學習者(ELL),涵蓋 30 種不同的母語背景,如阿拉伯語、日語、中文、西班牙語等。

內部效度

折半信度Split-half Reliability

機評的總分信度為 .96,人類專家評分的總分信度亦為 .96,顯示機評對信度的影響極小,測驗能提供高度一致的分數。

次分數相關性Sub-score Correlation

各次分數間高度相關(口說與聽力 .82、說話方式與聽力 .85),但未達完全相關(1.0),顯示次分數確實測量到語言能力的不同面向。

機評與人評之比較Machine vs. Human Scoring

同一批錄音下,機評與人評高度相關(總分 .96、聽力 .95、口說 .96),顯示機器評分與仔細的人類評分幾乎無法區分。

與已知母體的關係

驗證測驗能否反映母語人士與英語學習者間的預期差異。結果顯示,26 位母語人士的平均總分為 87.48 分,且無人低於 70 分;234 位英語學習者的分數則廣泛分布,平均為 61.26 分,僅 36% 高於 70 分。累積密度函數(CDF)圖表顯示,總分能有效區分母語與非母語群體。

與 CEFR 的關聯

透過以題目為中心(item-centered)與以考生為中心(candidate-centered)兩種獨立方法,將測驗分數對應至 CEFR 等級,兩者估計值高度一致(r=.99)。對應標準如下:

CEFR 等級 Versant 分數區間
A1 22 – 29 分
A2 30 – 35 分
B1 43 – 50 分
B2 59 – 66 分
C1 76 – 84 分
C2 85 – 90 分
06CONCLUSIONS

結論

驗證研究的資料支持以下結論:

精確可靠的技能估計Precision

測驗能產生精確且可靠的技能估計值。

有效區分母語與學習者Group Separation

總分能有效區分第一語言為英語者與英語語言學習者。

具診斷價值的次分數Diagnostic Value

次分數具合理區別度,能提供各項技能的診斷資訊。

機評貼近人評Scoring Consistency

機器評分與人類評分具有極高的相關性。

符合 EEOC 準則EEOC Compliance

驗證數據符合美國平等就業機會委員會(EEOC)針對人員甄選程序中,關於測驗可靠性與效度的準則要求。

想進一步了解 Versant 口說與聽力測驗

歡迎與我們聯繫,顧問將依貴公司的情境提供說明。

聯繫我們