跳到主要內容

性格測驗準不準?怎麼挑一份信得過的測驗

判斷一份性格測驗,題目和分數說明是最早拿得到的線索,結果頁反而看不太出來;要知道它適不適合某種用途,還得看研究證據。

撰文:Traitium閱讀約3分鐘
一片透明玻璃透鏡,懸在鼠尾草綠與黃銅色層層交疊的地形上方。

這段描述,朋友讀了也會點頭

做完測驗,結果頁寫著:「你在熟人面前很放得開,到了陌生場合,卻習慣先安靜觀察一陣子。」你馬上想起去年公司尾牙,自己整晚都黏在同組同事旁邊,心想:好準。可是把這句話貼到 LINE 群組,每個朋友大概都想得出自己的例子。

讀結果時冒出的那句「好準」,很難拿來判斷測驗本身好不好。1949 年,心理學家 Bertram Forer 發表了他在課堂上做的一個示範:學生先做一份測驗,之後各自拿到一段看似依個人作答寫成的性格描述。大家普遍覺得寫得很準,最後才知道全班拿到的是同一段文字。後來這種現象被稱為巴納姆效應。

回頭讀題目

想知道一份測驗量了什麼,題目是你最早拿得到的線索。讀讀這一題:「我個性開朗、喜歡認識新朋友,做決定也很果斷。」如果你在聚會上很自在,挑一家餐廳卻能猶豫二十分鐘,該選同意還是不同意?一題同時問了好幾件事,你的答案就說不清是在回應哪一件,算進分數以後也一樣說不清。

AERA、APA 和 NCME 共同制定的《教育與心理測驗標準》,把題目內容(主題、用字和形式)和它想量的特質對不對得上,列為效度證據的重要來源。你可以先檢查題目本身:每一題是不是只問一件具體的事,有沒有說清楚要以哪段時間、哪種場合為準。接著留意題目分不分得出「我通常這樣做」「我做得到」和「我希望自己是這樣」。

題數和精確度有關:同一份《標準》提到,用性質相近的題目把測驗加長,一般能提高分數的一致性。只是第三次讀到換了說法的「我習慣事先排好行程」時,你大概也看得出來:這幾題讓這個習慣的分數更一致,卻沒問到你在別的場合怎麼做。

信度與效度,各問一件事

信度關心的是分數的一致程度:同一套測驗重複施測,分數能不能大致對得上。檢驗方式有好幾種,其中一種是隔一段時間讓同一群人再做一次。Myers & Briggs Foundation 介紹 MBTI 的信度時,就寫明了研究條件:1,721 位成人,兩次作答相隔 6–15 週。有這些條件,你才知道它報告的一致性是在什麼情況下得到的。

效度問的則是分數能不能照測驗說的方式解讀。分數穩定,或讀起來很準,都還不足以支持某種解讀:假設一組題目問的全是你喜不喜歡熱鬧,隔幾個月再答,分數也差不多;但要把這個分數說成你在陌生人面前自不自在,就得另外拿出證據。《標準》寫得很明白,效度檢驗的是某個用途下對分數的解讀,不是測驗本身,所以不加限定地說「這份測驗的效度」並不正確。看到測驗自稱效度很高,可以追問一句:用來做什麼?也看看它引用的研究,做的是不是這份測驗、這個版本。

自己查得到的事

要查到多細,看你打算拿結果做什麼。《標準》提到,決定越重大、越難挽回,對分數精確度的要求就越高:拿結果在聚餐時當話題,可以寬鬆一點;拿它考慮要不要換工作,就該一項一項查清楚。有些測驗的說明頁還會寫出它適合做什麼、哪些用途還沒研究過。

示意圖

挑測驗時可以查的六件事

  • 一題只問一件事

    讀幾道題目,看你是否清楚自己在回答哪一種行為。

  • 維度有定義

    每個分數量什麼,高低兩端各代表什麼。

  • 有重測資料

    隔多久重測、找什麼人測,結果有多一致。

  • 效度講明用途

    證據支持的是哪一種解讀,用在什麼場合。

  • 研究對得上工具

    引用的研究,做的是不是同一份測驗、同一個版本。

  • 換個人讀也成立嗎

    把結果裡的描述換成朋友的名字,還說得通嗎?

前五項在說明頁或題目裡就查得到,最後一項要等拿到結果。

連續分數多給了什麼

連續分數的好處,是不必把你歸到某一邊。同樣被歸為外向的兩個人,可能一個剛好越過分界,一個幾乎每題都站在外向那一端,類別上卻看不出差別。只是分數印到個位數,測量不見得精確到個位數,73 和 74 差的那一分,別太當真。數字也需要說明:分數越高代表哪一端?50 是中間點還是平均值?這是百分位,還是測驗自訂的量尺?

Traitium 也用連續分數:用 50 道題目算出你在 14 個維度上的位置,不給四字母類型。計分只看答案、不看語言,同一組答案在英文、繁體中文或日文版都會得到相同的分數。50 道題、連續分數是我們選的設計,三種語言同分也只說明共用一套計分規則,這幾點都不證明效度;題目在三種語言裡讀起來是不是同一個意思、分數能不能照說明解讀,要看的是前面那幾種證據。每個維度量什麼、分數往哪一端走代表什麼,則寫在維度說明頁上,作答前就能讀。

資料來源與說明

  1. [1]AERA、APA、NCME:《教育與心理測驗標準》(2014)

    第 1 章談效度,包括以題目內容作為證據,以及「被評估的是分數的解讀與用途」;第 2 章談精確度,包括以性質相近的題目加長測驗通常能提高精確度,以及精確度的要求如何隨決定的輕重提高;第 4 章談測驗長度,題數要在作答時間與分數精確度之間取捨,題目較多一般較精確。

  2. [2]Myers & Briggs Foundation:Reliability and Validity

    頁面上的重測研究出自 2018 年版 MBTI 手冊,寫明了樣本人數與兩次作答的間隔。

  3. [3]B. R. Forer:The fallacy of personal validation(1949)

    課堂示範的原始論文,刊於 Journal of Abnormal and Social Psychology 第 44 卷第 1 期,118–123 頁。

自己讀讀這 50 道題目

免費作答,看你在 14 個維度上的分數,再用自己的經驗對照。

從第 1 題開始

所有指南