Подпишитесь, чтобы получать уведомления о новых публикациях А.Г. Шмелёва!

Длина тестовой шкалы, границы оценок и … метод Монте-Карло

Автор публикации:

5 июля 2017

Более позднее предисловие

Эта публикация имеет прямое отношение к более поздним значимым проектам. Например, к таком проект как КВАЛИМИН. По отдельным субшкалам теста КВАЛИМИН (в которых только 10 заданий), увы, нельзя принимать никаких отдельных (изолированных) решений: слишком мало заданий! Решения можно принимать (да и то осторожные решения рекомендательного типа) только по интегральной шкале КВАЛИМИН, в которой присутствуют все 50 заданий.

=====================

Итак, коллеги, давайте-ка применим к нашей дискуссии самый надежный и наглядный метод — метод Монте-Карло, то есть метод моделирования (в данном случае распределения тестовых баллов) с помощью функции случайных чисел (в русскоязычной программе MS Excel эта функция называется СлЧис, а не Random).

Напомню, что в ходе наших опросов и дискуссий большинство коллег высказались за то, что нижняя граница «тройки» (минимальной зачетной оценки) — это 50 процентов, а минимальная длина тестовой шкалы — 10 заданий. Посмотрим теперь с помощью метода Монте-Карло, совпадают ли эти требования к тесту , не противоречат ли они друг другу.

С помощью программы Эксель (желающим я готов выслать эту расчетную таблицу по запросу) я сгенерировал по 10 000 (десять тысяч!) случайных наблюдений. Как будто 10 тысяч испытуемых нажимали случайным образом на кнопки (заполняли крестиками бланк ответов случайным образом). В одном случае они как будто отвечали на 10 вопросов с 4 готовыми ответами (один правильный), а во втором случае — на 20 вопросов. Таким образом, один тест у нас более короткий (за который голосует большинство коллег), а второй — более длинный (который требуется по документу СТП — Стандарт тестирования персонала). Напомню, что в тесте из 20 заданий с одним правильным ответом нельзя набрать более 20 сырых очков, то есть это шкала сырых баллов длиной от 0 до 20 (как написано в Стандарте).

Пояснение к графикам: по горизонтальной оси X отложены сырые баллы, по вертикальной оси Y — процент испытуемых, набравших данный сырой балл.

Как видим, на первой гистограмме целых 189 человек (из 10 тысяч) у нас набрали бы 6 баллов и выше из 10 возможных по первому (короткому тесту) — превзошли бы границу в 50 процентов сырых очков. Это означает, что примерно 2 человека из каждой сотни покажут положительную оценку, если мы ее установим на границе 50 процентов. Поясню, что число 189 я получил путем суммирования числа испытуемых, показавших баллы 6, 7 и 8. Их оказалось 158+25+6 = 189 человек.
Итак, запоминаем следующее: 1 человек из группы в 50 испытуемых совершенно случайно у нас получил бы положительную оценку (!). Почувствовали, что мы получили противоречие, да? Вероятность случайного высокого результата в случае теста длиной в 10 заданий на самом деле слишком велика!

Посмотрим, сколько же «человек» перешли границу в 50 процентов в тесте длиной в 20 заданий. Суммируем частоты для всех, кто показал баллы 11 и выше.
Это 32+1+3=36 человек из 10 тысяч. Это менее 4 человек из 1000 или менее 1 человека из 100.
Таким образом, в этом случае мы достигаем хотя бы стандартного уровня p<0,01 — такова вероятность ошибочного вывода в тесте длиной в 20 заданий (зачисления в успевающие заведомо неподготовленного студента, например). Ну как, чувствуете, что 20 заданий — это очень мягкий компромисс? Если брать уровень ошибки p<0,001 (1 случайный положительный результат из тысячи), то требование к длине теста получается еще жестче — требуется не 20, а уже 30 заданий.

График распределения тестовых баллов для 30 заданий я опубликую позднее. Обещаю.

Кстати, я сам ранее частенько грешил тем, что пользовался приближенной оценкой границ случайного интервала с помощью очень простого (на пальцах можно все посчитать) биномиального распределения Бернулли. Но при p<0,5 (при отклонение от равной вероятности правильного ответа и ошибки) этот критерий дает погрешность. Лучше и строже работает критерий Хи-квадрат. Он дает почти такую же строгую и жесткую оценку нижних границ, как и метод Монте-Карло.

Виталий Федорченко:

Александр Георгиевич, добрый день.
Спасибо за наглядную иллюстрацию! Весьма убедительно.
Вопрос новичка: а как быть с ипсативной технологией предъявления заданий? Все ли также — желаемые 20 заданий на каждую шкалу, просто одни вопрос для нескольких шкал или есть дополнительные условия / ограничения?

Шмелев А.Г.

Виталий,

спасибо за Ваш позитивный отклик.

Что касается ипсативных опросников, то они тоже бывают разные*. Это не всегда бинарный выбор «или-или». Бывают опросники, допускающие промежуточные градации в ответах. Но все равно ситуация нередко выглядит даже острее, чем при выборе из четырех-пяти ответов, так как при случайном выполнении ипсативного бинарного теста «или-или» ожидаемый балл оказывается в самом центре шкалы сырых баллов (так как вероятность выбора одного полюса ровна 0,5). Из-за этого область диагностически ценных баллов сдвигается еще ближе к полюсу. Правда, не только к высокому, но и к низкому полюсу (получаем биполярные тестовые шкалы, в которых низкий полюс тоже получает определенную интерпретацию).

Стоит сделать такую оговорку, что сам по себе прием «ипсативности» не сильно меняет ситуацию в отношении надежности. Он направлен на снижение артефакта социальной желательности — на другое, стало быть, психометрическое свойство теста — на достоверность.

Другое дело, что во многих психологических тестах в отличие от тестов знаний мы вообще не ставим перед собой прикладной задачи различения четырех градаций в оценочных итоговых категориях: «отлично-хорошо-удовлетворительно-неудовлетворительно». Мы ставим задачу различения трех диагностических категорий: «высокая группа», «средняя», «низкая». Поэтому зона неопределенности (случайных баллов) и «средняя» группа вообще не различимы. при десяти заданиях в бинарном ипсативном тесте можно отнести к высокой группе только баллы 9 и 10, а к низкой — баллы 0 и 1. А баллы 8 и 3 уже не попадают в крайние области, а попадают в область неопределенности — в среднюю область. Таким образом, полноценную стандартизированную шкалу стэнов для таких шкал создать, строго говоря, нельзя — имеется только 2, а не 3 градации внутри крайней группы (шкала стэнов, напомню, относит к высокой группе результат с баллами 8,9 и 10, а к низкой — 0,1 и 2).

А вот если в одной шкале в бинарном ипсативном тесте присутствует 20 заданий, то граница высокой группы включает уже больше трех градаций на сырой шкале. По критерию Хи-квадрат значимым на уровне p<0,01 (хотя бы на этом уровне) оказывается уже балл 16 (и более высокие баллы), а на уровне p<0.001 балл 18.
Таким образом, строго говоря, к высокой группе мы должны относить испытуемых с сырыми баллами 18,19 и 20, а к низкой группе — с баллами 0,1 и 2.
Таким образом, в случае 20 заданий к такой сырой шкале вполне применим перевод (конвертация) в стандартизированную шкалу стэнов. Позднее сегодня (или завтра) я постараюсь для бинарного ипсативного теста тоже реализовать метод Монте-Карло и построить распределение случайных тестовых баллов.



Вот… решил тут повторить реплику, с которой разразился в группе TESTbyTEST на Фейсбуке:

«Коллеги, меня тут покритиковали. что в связи с длиной теста (по числу заданий) я ухожу в такие «дебри», которые важны только для разработчиков тестов. А ведь ситуация в этой области давно сложилась как драматичная и парадоксальная. Можно так сказать, что «спасение пользователей — дело рук самих пользователей»… Почему? — А потому что тесты чаще всего начинают с огромной легкостью «лепить» как раз те горе-разработчики, которые не подозревают, что существуют в этом деле какие-то проблемы и ограничения. Вы представляете себе, если бы это было в области производства автомобилей или компьютеров? — Представляете, если бы все, кому не лень, взялись бы сочинять… компьютеры. Мда… впрочем, было бы сразу видно, что такой «горе-компьютер» не умеет даже дважды два посчитать. Да и пользователи в этой области (даже «блондинки») считают своим долгом немножко просветиться про память, про быстродействие…. А что с тестами? Кто-нибудь озадачивается, какой он должен быть длины (по числу заданий)? — Мне теперь все больше кажется, что пользователи скорее в этой области обретут грамотность, чем разработчики. Вот для этого я пытаюсь кого-то собрать здесь — на «виртуальные ужины» в группе TESTbyTEST. Пока… широкого понимания у пользователей не снискал…»

комментировать


Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Актуальный опрос

Ваши вопросы

Есть вопрос к автору блога?
Вы можете задать его здесь -> <клик>

Рубрики

Последние комментарии:

Облако меток