N. Schindler и др. (Schindler et al., 2007) сообщили об использовании подхода W.K.B. Hofstee при определении проходных баллов за прохождение хирургической практики. Поскольку цель состояла в том, чтобы установить за прохождение практики общий проходной балл вместо индивидуальных оценок (тестовые экзамены, ОСКЭ, оценки за прохождение практики, рейтинги уровня профессионализма), группа по определению стандарта приняла решение о целесообразности использования метода W.K.B. Hofstee. Использование многочисленных взаимосвязанных оценок привело группу к выводу об установлении компенсационных норм, хотя недостаток профессионализма может привести к их невыполнению. Прежде чем ответить на 4 вопроса по методу W.K.B. Hofstee, члены экспертной группы проанализировали распределение баллов для всех студентов, а также для тех, кто не сдал экзамен в предыдущие годы, наряду с критериями выставления оценок и экзаменационными материалами. Авторы обнаружили, что эксперты достигли высокого уровня согласия и что процент сдавших был выведен обоснованно применительно к предыдущим данным по их успеваемости.
Выбор метода для определения стандарта
При наличии множества доступных методов, возможно, будет трудно решить, какой из них является лучшим. При выборе метода определения стандарта необходимо руководствоваться практическими соображениями. Метод должен позволять выносить суждения на основе информации; предпочтительны процессы, позволяющие выносить экспертные суждения с учетом результатов выполнения задания. Выбранный метод должен быть тесно увязан с целью оценки. Метод должен требовать вдумчивых усилий от тех, кто участвует в процессе, и в его основе должны лежать исследования. Наконец, метод должен быть легким для понимания и простым в реализации.
Важно иметь в виду, что исследование по определению стандарта позволит вывести рекомендуемый проходной балл и что балл должен соответствовать уровню выполнения задания, согласующегося с целью экзамена и процессом определения стандарта. Например, если экзамен используется для выявления студентов, нуждающихся в дополнительном обучении или исправлении, то проходной балл позволяет отделить группу студентов, готовых к следующему этапу обучения, от группы, которой следует повторить курс. В этом случае уровень выполнения заданий может быть не таким высоким, как уровень, соответствующий компетентности в самостоятельной практике. Если экзамен используется для выявления студентов, готовых к выпуску и приступить к практике под руководством опытного специалиста, то сдавшие экзамен обладают характеристиками, подтверждающими готовность приступить к практике под руководством наставника. Результат прохождения этих экзаменов имеет разное значение, и при окончательном определении проходного балла эти различия должны учитываться. Хотя определить наилучший метод невозможно, выбор должен основываться на цели экзамена, а также на практических соображениях, изложенных в этом руководстве.
Внедрение стандарта
Поскольку исследование по определению стандарта позволяет получить рекомендуемый проходной балл, существуют дополнительные вопросы, которые необходимо рассмотреть до внедрения результатов, полученных в процессе установления стандарта. Одно из важных решений, которое необходимо принять, заключается в том, будет ли проходной балл компенсационным или конъюнктивным. Для проведения ОСКЭ и экзаменов с участием стандартизированных пациентов обычно используется несколько станций. Если оценка усреднена (или суммирована) по всем кейсам, проходной балл должен быть получен аналогичным образом (т. е. усреднен или суммирован по всем кейсам). В этом примере норма будет считаться компенсационной; испытуемые, которые наберут или превысят проходной балл, пройдут, и плохие результаты на одной станции могут компенсироваться лучшими результатами на другой станции. В качестве альтернативы проходной балл может выводиться для каждого кейса/станции, и дополнительное требование может состоять в том, что для прохождения аттестации необходимо получить проходной балл по определенному количеству кейсов. В этом случае норма будет конъюнктивной. Поскольку ситуационные задания часто используются для измерения как клинических навыков, так и навыков межличностного общения, проходные баллы могут выводиться отдельно для каждого из этих навыков, и требование для прохождения будет заключаться в том, чтобы соответствовать или превышать проходной балл в каждой области. Такой подход также можно было бы считать конъюнктивным.
При принятии заключения о том, будет ли решение о сдаче или несдаче компенсационным или конъюнктивным, важно учитывать результаты исследований, проведенных в этой области. Результаты выполнения по разным задачам могут весьма различаться (Traub, 1994), и результаты, продемонстрированные в одном кейсе, вряд ли будут надежным показателем уровня подготовки испытуемого (Linn, Burton, 1994). Конъюнктивные нормы, основанные на требованиях отдельных станций, приведут к более высокому проценту не сдавших и могут повлечь за собой неправильные решения из-за ошибки измерения (Hambleton, Slater, 1997; Ben-David, 2000). В то время как более высокие проценты не сдавших также будут обусловлены конъюнктивными нормами, учитывающими соответствующие области навыков, разумно требовать выведения проходного балла для каждой области без возможности компенсации за счет других областей. M.F. Ben-David (Ben-David, 2000) полагает, что большое значение при принятии решения о компенсационных и конъюнктивных нормах имеет анализ конструкта, измеряемого с помощью оценки. Важными критериями, которые следует учитывать при принятии решения, являются цель оценки и обратная связь о результатах. Например, было бы очень полезно, чтобы испытуемые знали, что им необходимо улучшить свои навыки физикального обследования, но что они обладают достаточными навыками сбора анамнеза и коммуникативными навыками. В этом случае было бы разумно установить отдельные проходные баллы исходя из измеряемых навыков.
Еще одним фактором является формат представления результатов экзамена испытуемым и другим заинтересованным сторонам. Если ОСКЭ проводится в качестве курсовой оценки, не сдавшие экзамен студенты (и их преподаватели), возможно, захотят узнать о сильных и слабых сторонах, чтобы сосредоточить свои усилия на повышении квалификации. Даже студенты, сдавшие экзамен, возможно, захотят узнать, есть ли какие-либо области, в которых они могли бы совершенствоваться. Предоставление обратной связи важно, особенно для не сдавших экзамен испытуемых (Livingston, Zieky, 1982; American Educational Research Association et al., 1999).
Наконец, важно учитывать процент сдавших экзамен. Понимание последствий принимаемых решений жизненно важно для обеспечения понимания и утверждения процесса лицами, принимающими решения. Маловероятно, что будет возможно вывести рекомендуемый проходной балл во время совещания по определению стандарта, поэтому следует провести встречу с заинтересованными сторонами (например, преподавателями, заведующими кафедрами), чтобы проинформировать их о результатах исследования и о последствиях (то есть о количестве сдавших).
Поддержание стандарта
После проведения совещаний, выведения и утверждения проходного балла следует подумать о том, как будет формироваться проходной балл для следующего экзаменационного цикла. Поскольку результаты выполнения заданий испытуемыми и сложность экзамена с течением времени могут меняться, один и тот же проходной балл может иметь разный эффект. В случае пересмотра экзаменационных материалов необходимо еще раз провести совещание по определению стандарта. Даже при отсутствии изменений в экзаменационных материалах важно следить за результатами выполнения заданий испытуемыми и сложностью экзамена, а также за последствиями введения проходного балла (то есть за изменениями процента сдавших). Если тест станет легче (то есть испытуемые получат более высокие баллы), а проходной балл останется прежним, то процент сдавших, скорее всего, увеличится. И наоборот, если тест станет более сложным, процент сдавших, скорее всего, снизится. Рекомендуется регулярно пересматривать определение стандарта, а также проходной балл в свете изменений экзамена. Мониторинг успеваемости на экзамене имеет особое значение, если он используется для определения квалификации испытуемого, независимо от того, означает ли это переход на следующий уровень обучения или начало самостоятельной практики.
Заключение
Несмотря на обширные исследования по определению стандартов как для тестов с несколькими вариантами ответа, так и для практических экзаменов, не существует правильного проходного балла и наилучшего метода. Различные методы дают разные результаты. Выбор метода зависит от цели исследования и ресурсов, доступных в рамках мероприятия по определению стандарта. Указанные методы, рекомендации и примеры приведены с целью предоставления информации, необходимой для принятия решений относительно выбора метода, подготовки к совещанию, проведения совещания и анализа полученных данных, а также внедрения и поддержания стандартов.
Заявление об отсутствии конфликта интересов: авторы заявляют об отсутствии конфликта интересов. За содержание и написание настоящей статьи авторы несут единоличную ответственность.
Литература/References
1. American Educational Research Association, American Psychological Association, National Council on Measurement in Education, 1999. Standards for educational and psychological testing. American Educational Research Association, Washington DC.
2. Angoff W.H. Scales, norms, and equivalent scores. In: Thorndike R.L, ed. Educational measurement. Washington, DC: American Council on Education. 1971, p. 508-600.
3. Bandaranayake R.C. Setting and maintaining standards in multiple choice examinations: AMEE Guide No. 37. Med Teach. 2008; 30: 836-45.
4. Ben-David M.F. AMEE Guide No. 18: Standard setting in student assessment. Med Teach. 2000; 22: 120-30.
5. Beuk C.H. A method for reaching a compromise between absolute and relative standards in examinations. J Educ Measure. 1984; 21: 147-52.
6. Boulet J.R., De Champlain A.F., McKinley D.W. Setting defensible performance standards on OSCEs and standardized patient examinations. Med Teach. 2003; 25: 245-9.
7. Burrows P.J., Bingham L., Brailovsky C.A. A modified contrasting groups method used for setting the passmark in a small scale standardised patient examination. Adv Health Sci Educ Theory Pract. 1999; 4: 145-54.
8. Clauser B.E., Clyman S.G. A contrasting-groups approach to standard setting for performance assessments of clinical skills. Acad Med. 1994; 69: S42-S44.
9. Cohen-Schotanus J., van der Vleuten C.P.M. A standard setting method with the best performing students as point of reference: Practical and affordable. Med Teach. 2010; 32: 154-60.
10. De Gruijter D.N.M. Compromise models for establishing examination standards. J Educ Measure. 1985; 22: 263-9.
11. Dijkstra J., Van der Vleuten C.P.M., Schuwirth L.W.T. A new framework for designing programmes of assessment. Adv Health Sci Educ Theory Pract. 2010; 15: 379-93.
12. Downing S.M., Lieska N.G., Raible M.D. Establishing passing standards for classroom achievement tests in medical education: A comparative study of four methods. Acad Med. 2003; 78: S85-S87.
13. Downing S.M., Tekian A., Yudkowsky R. Procedures for establishing defensible absolute passing scores on performance examinations in health professions education. Teach Learn Med. 2006; 18: 50-7.
14. Ebel R. Essentials of educational measurement. 2nd ed. Englewood Cliffs, NJ: Prentice-Hall. 1972.
15. Frank J.R., Snell L.S., Cate O.T, Holmboe E.S., Carraccio C., Swing S.R., Harris P., Glasgow N.J., Campbell C., Dath D., et al. Competency-based medical education: Theory to practice. Med Teach. 2010; 32: 638-45.
16. Geisinger K.F. Using standard-setting data to establish cutoff scores. Educ Measure: Issu Pract. 1991; 10: 17-22.
17. Geisinger K.F., McCormick C.M. Adopting cut scores: Post-standardsetting panel considerations for decision makers. Educ Measure: Issu Pract. 2010; 29: 38-44.
18. Haladyna T., Hess R. An evaluation of conjunctive and compensatory standard-setting strategies for test decisions. Educ Assess. 1999; 6: 129-53.
19. Hambleton R.K., Jaeger R.M., Plake B.S., Mills C. Setting performance standards on complex educational assessments. Appl Psychol Measur. 2000; 24: 355-66.
20. Hambleton R.K., Slater S.C. Reliability of credentialing examinations and the impact of scoring models and standard-setting policies. Appl Measur Educ. 1997; 10: 19-28.
21. Hofstee W.K.B. The case for compromise in educational selection and grading. In: Anderson S.B., Helmick J.S., ed. On educational testing. San Francisco, CA: Jossey-Bass. 1983, p. 109-27.
22. Holmboe E.S., Sherbino J., Long D.M., Swing S.R., Frank J.R. The role of assessment in competency-based medical education. Med Teach. 2010; 32: 676-82.
23. Jaeger R.M. Selection of judges for standard-setting. Educ Measu: Iss Pract. 1991; 10: 3-14.
24. Kane M.T. The assessment of professional competence. Eval Health Prof. 1992; 15: 163-82.
25. Kane M.T. Validating interpretive arguments for licensure and certification examinations. Eval Health Prof. 1994; 17: 133-59; discussion 236-41.
26. Kane M.T. Validation. In: Brennan R.L., ed. Educational measurement. Westport, CT: American Council on Education and Praeger Publishers. 2006, p. 17-64.
27. Kaufman D.M., Mann K.V., Muijtjens A.M.M., van der Vleuten C.P.M. A comparison of standard-setting procedures for an OSCE in undergraduate medical education. Acad Med. 2000; 75: 267-71.
28. Linn R.L., Burton E. Performance-based assessment: Implications of task specificity. Educ Measure: Issu Pract. 1994; 13: 5-8.
29. Livingston S.A., Zieky M.J. Passing scores: A manual for setting standards of perfromance on education and occupational tests. Educ Testing Serv. Princeton, New Jersey. 1982.
30. Miller G.E. The assessment of clinical skills/competence/performance. Acad Med. 1990; 65: S63-S67.
31. Nedelsky L. Absolute grading standards for objective tests. Educ Psychol Measur. 1954; 14: 3-19.
32. Nestel D., Kneebone R., Black S. Simulated patients and the development of procedural and operative skills. Med Teach. 2006; 28: 390-1.
33. Norcini J., Burch V. Workplace-based assessment as an educational tool: AMEE Guide No. 31. Med Teach. 2007; 29: 855-71.
34. Norcini J.J. Principles for setting standards on certifying and licensing examinations. In: Rothman A.I., Cohen R., ed. The Sixth Ottawa Conference on Medical Education. Toronto: University of Toronto Bookstore. 1994, p. 346-7.
35. Norcini J.J. Work based assessment. Br Med J. 2003; 326: 753-5.
36. Norcini J., McKinley D. Assessment methods in medical education. Teach Teacher Educ. 2007; 23: 239-50.
37. Norcini J.J., Stillman P.L., Sutnick A.I., Regan M.B., Haley H.L., Williams R.G., Friedman M. Scoring and standard setting with standardized patients. Eval Health Prof. 1993; 16: 322-32.
38. Patil N.G., Saing H., Wong J. Role of OSCE in evaluation of practical skills. Med Teach. 2003; 25: 271-2.
39. Pell G., Fuller R., Homer M., Roberts T. How to measure the quality of the OSCE: A review of metrics - AMEE guide no. 49. Med Teach. 2010; 32: 802-11.
40. Raymond M.R., Reid J. Who made thee a judge? Selecting and training participants for standard setting. In: Cizek G.J., ed. Setting performance standards: Concepts, methods, and perspectives. Mahwah, NJ: Lawrence Erlbaum Associates. 2001, p. 119-58.
41. Reznick R.K., Blackmore D., Dauphine´e W.D., Rothman A.I., Smee S. Large-scale high-stakes testing with an OSCE: Report from the Medical Council of Canada. Acad Med. 1996; 71: S19-S21.
42. Rothman A.I., Cohen R. A comparison of empirically- and rationallydefined standards for clinical skills checklists. Acad Med. 1996; 71: S1-S3.
43. Schindler N., Corcoran J., DaRosa D. Description and impact of using a standard-setting method for determining pass/fail scores in a surgery clerkship. Am J Surg. 2007; 193: 252-7.
44. Smee S.M., Blackmore D.E. Setting standards for an objective structured clinical examination: The borderline group method gains ground on Angoff. Med Educ. 2001; 35: 1009-10.
45. Traub R.E. Facing the challenge of multidimensionality in performance assessment. In: Rothman A.I., Cohen R., ed. Proceedings of the Sixth Annual Ottawa Conference on Medical Education. Toronto: University of Toronto Bookstore. 1994, p. 9-11.
46. Wood T.J., Humphrey-Murto S.M., Norman G.R. Standard setting in a small scale OSCE: A comparison of the modified borderline-group method and the borderline regression method. Adv Health Sci Educ. 2006; 11: 115-22.