性格測驗準不準?怎麼挑一份信得過的測驗
判斷一份性格測驗,題目和分數說明是最早拿得到的線索,結果頁反而看不太出來;要知道它適不適合某種用途,還得看研究證據。

這段描述,朋友讀了也會點頭
做完測驗,結果頁寫著:「你在熟人面前很放得開,到了陌生場合,卻習慣先安靜觀察一陣子。」你馬上想起去年公司尾牙,自己整晚都黏在同組同事旁邊,心想:好準。可是把這句話貼到 LINE 群組,每個朋友大概都想得出自己的例子。
讀結果時冒出的那句「好準」,很難拿來判斷測驗本身好不好。1949 年,心理學家 Bertram Forer 發表了他在課堂上做的一個示範:學生先做一份測驗,之後各自拿到一段看似依個人作答寫成的性格描述。大家普遍覺得寫得很準,最後才知道全班拿到的是同一段文字。後來這種現象被稱為巴納姆效應。
回頭讀題目
想知道一份測驗量了什麼,題目是你最早拿得到的線索。讀讀這一題:「我個性開朗、喜歡認識新朋友,做決定也很果斷。」如果你在聚會上很自在,挑一家餐廳卻能猶豫二十分鐘,該選同意還是不同意?一題同時問了好幾件事,你的答案就說不清是在回應哪一件,算進分數以後也一樣說不清。
AERA、APA 和 NCME 共同制定的《教育與心理測驗標準》,把題目內容(主題、用字和形式)和它想量的特質對不對得上,列為效度證據的重要來源。你可以先檢查題目本身:每一題是不是只問一件具體的事,有沒有說清楚要以哪段時間、哪種場合為準。接著留意題目分不分得出「我通常這樣做」「我做得到」和「我希望自己是這樣」。
題數和精確度有關:同一份《標準》提到,用性質相近的題目把測驗加長,一般能提高分數的一致性。只是第三次讀到換了說法的「我習慣事先排好行程」時,你大概也看得出來:這幾題讓這個習慣的分數更一致,卻沒問到你在別的場合怎麼做。
信度與效度,各問一件事
信度關心的是分數的一致程度:同一套測驗重複施測,分數能不能大致對得上。檢驗方式有好幾種,其中一種是隔一段時間讓同一群人再做一次。Myers & Briggs Foundation 介紹 MBTI 的信度時,就寫明了研究條件:1,721 位成人,兩次作答相隔 6–15 週。有這些條件,你才知道它報告的一致性是在什麼情況下得到的。
效度問的則是分數能不能照測驗說的方式解讀。分數穩定,或讀起來很準,都還不足以支持某種解讀:假設一組題目問的全是你喜不喜歡熱鬧,隔幾個月再答,分數也差不多;但要把這個分數說成你在陌生人面前自不自在,就得另外拿出證據。《標準》寫得很明白,效度檢驗的是某個用途下對分數的解讀,不是測驗本身,所以不加限定地說「這份測驗的效度」並不正確。看到測驗自稱效度很高,可以追問一句:用來做什麼?也看看它引用的研究,做的是不是這份測驗、這個版本。
自己查得到的事
要查到多細,看你打算拿結果做什麼。《標準》提到,決定越重大、越難挽回,對分數精確度的要求就越高:拿結果在聚餐時當話題,可以寬鬆一點;拿它考慮要不要換工作,就該一項一項查清楚。有些測驗的說明頁還會寫出它適合做什麼、哪些用途還沒研究過。
示意圖
挑測驗時可以查的六件事
一題只問一件事
讀幾道題目,看你是否清楚自己在回答哪一種行為。
維度有定義
每個分數量什麼,高低兩端各代表什麼。
有重測資料
隔多久重測、找什麼人測,結果有多一致。
效度講明用途
證據支持的是哪一種解讀,用在什麼場合。
研究對得上工具
引用的研究,做的是不是同一份測驗、同一個版本。
換個人讀也成立嗎
把結果裡的描述換成朋友的名字,還說得通嗎?
連續分數多給了什麼
連續分數的好處,是不必把你歸到某一邊。同樣被歸為外向的兩個人,可能一個剛好越過分界,一個幾乎每題都站在外向那一端,類別上卻看不出差別。只是分數印到個位數,測量不見得精確到個位數,73 和 74 差的那一分,別太當真。數字也需要說明:分數越高代表哪一端?50 是中間點還是平均值?這是百分位,還是測驗自訂的量尺?
Traitium 也用連續分數:用 50 道題目算出你在 14 個維度上的位置,不給四字母類型。計分只看答案、不看語言,同一組答案在英文、繁體中文或日文版都會得到相同的分數。50 道題、連續分數是我們選的設計,三種語言同分也只說明共用一套計分規則,這幾點都不證明效度;題目在三種語言裡讀起來是不是同一個意思、分數能不能照說明解讀,要看的是前面那幾種證據。每個維度量什麼、分數往哪一端走代表什麼,則寫在維度說明頁上,作答前就能讀。
資料來源與說明
- [1]AERA、APA、NCME:《教育與心理測驗標準》(2014)
第 1 章談效度,包括以題目內容作為證據,以及「被評估的是分數的解讀與用途」;第 2 章談精確度,包括以性質相近的題目加長測驗通常能提高精確度,以及精確度的要求如何隨決定的輕重提高;第 4 章談測驗長度,題數要在作答時間與分數精確度之間取捨,題目較多一般較精確。
- [2]Myers & Briggs Foundation:Reliability and Validity
頁面上的重測研究出自 2018 年版 MBTI 手冊,寫明了樣本人數與兩次作答的間隔。
- [3]B. R. Forer:The fallacy of personal validation(1949)
課堂示範的原始論文,刊於 Journal of Abnormal and Social Psychology 第 44 卷第 1 期,118–123 頁。

