Подпишитесь, чтобы получать уведомления о новых публикациях А.Г. Шмелёва!

Выбираем границы оценок на шкале тестовых баллов КВАЛИМИН-26

Автор публикации:


Коллеги, в этой статье я даю описание 4-х возможных моделей принятия решений на основании результатов теста КВАЛИМИН. Дело ведь в том, что каждая вербальная оценочная категория подразумевает принятие какого-то решения.

ВНИМАНИЕ: для тех, кто не знаком с тестом КВАЛИМИН-26, ссылка для прохождения ознакомительной версии дается в конце этой статьи.

А вот ссылка на опрос (но все-таки лучше вначале прочитать эту статью и понять, что это такое — четыре модели, из которых предстоит выбирать):

Тест «Опрос-голосование «Границы оценок для теста КВАЛИМИН»»

ВЕСТИ С ПОЛЕЙ: на 8 июля у нас появились 20 первых участников голосования. Уже просматривается «модель-лидер», набравшая более 90% голосов (в условиях «мягкого выбора»). Но не буду разглашать результаты преждевременно. Нам необходимо собрать не меньше 30 участников (как показывает богатый опыт).

МОДЕЛЬ 1 — СТРОГАЯ ТЕОРЕТИЧЕСКАЯ (КРИТЕРИАЛЬНЫЕ НОРМЫ)

С марта по июнь этого 2026 года мы собрали 628 результатов по тесту знаний для психологов КВАЛИМИН-26. На рисунке 1 Вы видите, как выглядит эмпирическое распределение частот тестовых баллов на шкале ППО (процент правильных ответов). И Вы видите, как на это статистическое распределение «ложится» модель номер 1.

Рисунок 1. Гистограмма эмпирического распределения частот по тесту КВАЛИМИН и границы оценок в соответствии с типовыми ожиданиями и международными стандартами сертификации. Внимание: это и есть фактически модель номер 1 для экспертного голосования.

Балл выше 90% показали только 21 человек из 628, это приближенно 3% от выборки прошедших тест добровольцев. Это явно маловато, чтобы считать такой порог для оценки «отлично» статистически обоснованным (ну просто потому, что тест для большинства бывших студентов-отличников оказался достаточно трудным, о чем некоторые прямо написали в своих отзывах).

Если же «порог зачета» устанавливать в соответствии со строгими международными нормативами в точке ППО=70%, то как видим на гистограмме 1, этот порог у нас преодолели только лишь 40% участников (зеленые столбики), а больше половины (60%) оказались бы в «отсеве». На цветной схематичной картинке, вынесенной на обложку этого сообщения, площадь «зеленой зоны» — это примерно те 40%, которые получили бы зачет в результате применения такой «точки отсечения» (или «порога зачета», что есть синоним). Что значит «зачет» по теоретическому тесту в системе сертификационных экзаменов? — Это путевка на следующий этап экзамена (решение кейсов и-или собеседование с комиссией).

БОЛЕЕ МЯГКАЯ МОДЕЛЬ 2 — ЭМПИРИЧЕСКИЕ НОРМЫ

А есть ли какие-то основания для применения других границ для оценок по тесту КВАЛИМИН? — Да, конечно, есть! Прямо на этом «блоге Шмелева» Вы можете почитать мою статью, написанную еще в 2023 году и основанную на очень продолжительном, многолетнем опыте применения метода тестов для оценивания знаний студентов МГУ:

Метод тестов и границы оценок — Авторский блог А.Г. Шмелёва


Я много лет в МГУ применял на своем тесте по трудному для гуманитариев курсу «Психометрические основы психодиагностики» границу «отлично» не в районе ППО=90%, а в районе ППО=80%. На рисунке 2 Вы можете увидеть, как выглядят границы оценок, которые я фактически «нащупал» за много лет работы в МГУ:

Рисунок 2. Гистограмма схематизированного распределения частот по тесту «Психометрические основы психодиагностики» и границы оценок в соответствии c эмпирическим опытом автора. Это фактически модель номер 2 для экспертного голосования.

Что значит «нащупал»? — Дело в том, что границы оценок должны соответствовать не только абстрактным представлениям экспертов (преподавателей), но реальным ожиданиям, амбициям и возможностям самих испытуемых (студентов). Не менее 10% в МГУ — это студенты, которые привыкли думать о себе как о «постоянных отличниках по всем предметам» (а на некоторых курсах дело доходило и до 20% «записных отличников», которые нацелены на красный диплом и для них «катастрофой» становится любая «четверка»). Если вдруг большая часть из таких самых мотивированных (а иной раз и самых тревожно-ажитированных) студентов «провалится» ниже высшей оценки «отлично», то именно эта категория начнет возмущаться! Причем они будут возмущаться сильней, чем даже те, которые провалятся на оценку «неуд» (эти, как правило, вообще не посещают занятия, поэтому готовы ко всему).

Поэтому выставить всего лишь 3% высших оценок «отлично» — это значит нарваться на скандал, который будет угрожать самому применению метода тестов для аттестации студентов (!). Точно также нельзя ставить нижнюю границу «зачета» (границу для оценки «удовлетворительно») в районе ППО=70%. В этом случае получилось бы слишком много «двоечников» (больше половины!), которым грозит отчисление из университета за неуспеваемость. Двоечников с учетом «социально-политической обстановки в конкретном вузе» не может быть больше половины никак! — Максимум, что может выдержать администрация образовательного учреждения по доли студентов, которые попадают на пересдачу — это не больше 30-40% (да и то уже эта доля — это грандиозный скандал!). Как видите, на рис. 2 я старался установить нижнюю границу положительной оценки в районе ППО=50% и тем самым сократить долю студентов, обязанных прийти на пересдачу до 10% (хотя чаще получалось, что их оказывалось около 25 человек на курсе численностью в 150 студентов, то есть фактически в районе 15-16%).

Вы можете задать такой уместный вопрос: А что делать с людьми из категории «удовлетворительно», ведь в случае данной модели 2 их оказывается слишком много — целых 40%? Возможное решение: их тоже можно допускать до дальнейших этапов аттестации, но комиссия будет видеть их низкую оценку на предварительном тесте и может задавать дополнительные вопросы, основываясь на сомнениях в уровне подготовки данного соискателя.

САМАЯ МЯГКАЯ МОДЕЛЬ 3 — «РАВНОМЕРНЫЕ ИНТЕРВАЛЫ»

Являются ли границы, указанные на рисунке 2, этакой «незаконной поблажкой» (в интересах студентов, да и в интересах преподавателя, который не хочет накалять отношения с администрацией вуза)? — На самом деле нет, конечно! Если Вы откроете множество старинных учебников по методу тестирования (а их на иностранных языках вышло в 20 веке очень много — как раз в те годы, когда у нас «работало» постановление ЦК ВКП(б) от 1936 года «О педологических извращениях» и тесты были под запретом), то Вы, как правило, увидите следующую рекомендацию по буквенным грейдам (градациям) вербальных оценочных категорий:

«Отлично» (или категория А) — больше или равно 80% на шкале ППО,

«Хорошо» (или категория В) — больше или равно 60% на шкале ППО,

«Удовлетворительно» (или категория С) — больше или равно 40% на шкале ППО,

«Неудовлетворительно» (или категория D) — меньше 40% на шкале ППО.

Почему в прошлом веке были такие мягкие границы? — Потому что в середине 20 века доминировала стратегия разработки тестов и отбор заданий на основе классической гауссовской статистики: большинство заданий создавалось и отбиралось из расчета расщепления выборки «фифти-фифти» (половина испытуемых дает правильный ответ, а половина ошибается). В результате распределение сдвигалось своей медианой (и модой) к центру на шкале ППО.

Как видим, оценочные интервалы в модели 3 получаются по очень простой формуле: весь диапазон возможных значений ППО от 0% до 100% делится на пять интервалов равной длины (!). Хотя при этом грейды D и E, как правило, уже не различаются.

Если бы применили такой принцип к эмпирическому распределению баллов в тесте КВАЛИМИН, то получили бы гистограмму, которую Вы видите на рисунке 3:

Рисунок 3. Реальные доли разных оценок по тесту КВАЛИМИН в случае, когда границы оценок определены как равные интервалы на шкале ППО. Это модель номер 3 для экспертного голосования.

Если порог зачета установить по нижней границе оценки «хорошо» на диаграмме 3, то в этом случае в «отсев» попали бы уже не 60% участников тестирования, а только 36%, в то время, как 64% (почти две трети) смогли бы пройти в следующий круг — на следующий этап сертификации.

Возможно, что подход, изображенный на рисунке 3, в данном случае является наиболее… политкорректным решением. Ибо он учитывает определенные протестные настроения значительной части психологов-практиков и в этом смысле предлагает наиболее мягкое решение, которое, увы, снижает значимость самого этапа тестирования в ходе многоэтапной сертификации, но зато увеличивает долю лиц, которые перестают испытывать страх перед «бездушным компьютерным тестом».

Каковы недостатки модели 3? — На самом деле тест КВАЛИМИН целенаправленно разрабатывался в расчете на попадание медианы распределения не в точку ППО=50%, а в точку ППО=70%. Хотя фактически тест оказался несколько трудней для испытуемых, но реальная медиана оказалась все-таки намного выше точки ППО=50%, чтобы применять модель 3. На рис. 3 это выражается в том, что третий столбец значительно выше второго, а четвертый — выше первого (если считать столбы слева направо). В результате комиссия на заключительном этапе не получает нужной детализации в категориях соискателей: категории оказываются слишком грубыми и многочисленными.

МОДЕЛЬ 4 — КОМПРОМИССНАЯ С ДВУМЯ ПОПЫТКАМИ

А теперь прокомментируем «красную зону» и центральную «белую зону» на том схематичном цветном рисунке, который изображен на обложке статьи. По убеждению автора, грамотное управленческое решение по результатам тестирования предполагает не две категории на шкале, разделенные одной точкой отсечения, а, как минимум, три категории, разделенные двумя точками — «порогом зачета» (справа от него будет зеленая зона) и «порогом отсева» (слева будет красная зона). Таким образом, возникает некая средняя зона — между двумя крайними: «зеленой» и «красной» (можно было бы даже закрасить ее «желтым» цветом, следуя привычным сигналам светофора, но я решил избежать»пестрятины» на обложке).

Что делать с людьми, которые попали по результатам теста в «белую зону»? — Вот им надо бы дать право на «пересдачу» (в спорте это называется «утешительный старт»). Как вы знаете, даже в случае ЕГЭ с недавнего времени у выпускников школ появилось право на пересдачу. Так и следует поступить в случае теста КВАЛИМИН (!). То есть, 30%-40% «отличников» и «хорошистов» следовало бы сразу допускать до следующего этапа (с первой попытки), а вот тем, кто получил в первой попытке оценку «удов», надо дать вторую попытку — доступ к другому, контрольному варианту теста, который соответствует требованиям к так называемой «параллельной форме» (чтобы они могли не ждать следующего сезона, а пересдать тест уже через 2-3 недели — в конце текущей тестовой сессии).

Но… при таком подходе, как мы понимаем, нижняя граница для оценки «хорошо» должна, видимо, подняться с точки ППО=60% до точки ППО=70% (как это и показано на рисунке 1). Получается четвертая диаграмма:

Рисунок 4. Реальные доли разных оценок по тесту КВАЛИМИН в случае, когда для средней категории «удовлетворительно» допускается вторая попытка. Это модель 4.

Какие следствия для разработки боевого теста КВАЛИМИН возникают, если принять модель 4? — Надо создавать еще, как минимум, один дополнительный секретный вариант (или варианты), чтобы обеспечить пересдачу. Один из способов начать готовиться к этой работе — это провести финал так называемого «просветительского психологического диктанта» и начать отлаживать на финалистах (кандидатах в призеры) это самое «контрольное перетестирование».

Я предлагаю читателям пройти экспертное голосование по выбору модели из четырех возможных, изображенных на рисунках 1, 2, 3 и 4.

Тест «Опрос-голосование «Границы оценок для теста КВАЛИМИН»»

После сбора суждений будем здесь же обсуждать полученные результаты опроса-голосования.

P.S.

ВНИМАНИЕ: для тех читателей, кто еще не знаком с тестом КВАЛИМИН, рекомендую выполнить открытую ознакомительную версию из 50 вопросов (эта версия не требует обязательного ввода персональных данных). Зайти на этот тест лучше всего со страницы про «Народный конфиденциальный рейтинг»:

https://ht-line.ru/qualimin-rating


комментировать

7 ответов

  1. Владимир Александрович Старк

    Александр Георгиевич, психология — не математика, в психологии знание «матчасти» никак не гарантирует высоты практического профессионализма, который в психологии зависит (я не побоюсь этого слова) от мудрости терапевта.
    Читаю статьи относящиеся к категории научных, и моё исследовательское чутьё повергается в уныние. (

    1. Александр Шмелев

      Владимир, Вы повторяете распространенное заблуждение. Психология — это такой вид деятельности, где нет гарантий высоких достижений, но при низкой профподготовке появляется «гарантия со знаком минус» — это гарантия того, что результат будет плохой. Примерно такая же ситуация возникает в следующих областях деятельности:

      а) в театральном искусстве (исключения, когда отлично играет актер без актерского образования, лишь подчеркивают общее правило);
      б) в кулинарном искусстве (знание рецептов не гарантирует высокого качества изысканных блюд, но
      незнание рецептов — это та же самая «гарантия со знаком минус»);
      в) и так далее, и тому подобное.

      1. Владимир Александрович Старк

        Да, Александр Георгиевич, пожалуй я в своей дилетантской восторженности переборщил с приоритетностью таланта перед профессионализмом, тем более что его ни аршином не измерить, ни умом не понять. (

        1. Шмелёв А.Г.

          Владимир, я тоже с трепетом отношусь к талантливым людям! Но… высокий результат — это на 99% СОЧЕТАНИЕ! Чего с чем? — Талант плюс профессиональный опыт. Без ТАЛАНТа его нет, но и без профессионализма тоже нет в 99% случаев. Обычный человеческий «здравый смысл» плохо улавливает конъюнкцию (отношение логическое «И») как условие результата.

  2. Ирина

    Спасибо, иду голосовать.

    Опечатка, где рис.3 в тексте назван рисунком 2.

    чтобы применять модель 3. На рис.2 это выражается в том, что третий столбец значительно выше второго, а четвертый — выше первого (если считать столбы слева направо). В ре

  3. Беляев Алексей

    А как на счёт пороговых требований по субшкалам не ниже 55%, и по субшкале специализации не ниже 75%? Сейчас это роли не играет, а в будущем? Эти модели данный аспект не учитывают или пороговые требования само собой разумеются?

    1. Шмелёв А.Г.

      Алексей, Вы правы, что эти требования очень важны, но сейчас мы рассматриваем возможность применения методики КВАЛИМИН не столько в режиме экзамена, сколько в режиме… просветительской акции вроде «психологического диктанта». Тут важно больше привлечь людей и меньше их распугать 🙂


Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Актуальный опрос

Ваши вопросы

Есть вопрос к автору блога?
Вы можете задать его здесь -> <клик>

Рубрики

Последние комментарии:

Облако меток