Существует множество методов анализа количественных данных, собранных в форме экспертной валидации, но вне зависимости от используемого метода критерий приемлемости того или иного вопроса или шкалы следует определить заранее (Beck, Gable, 2001). Общими параметрами, используемыми для принятия решений о включении и исключении отдельных вопросов, являются коэффициент содержательной валидности, индекс содержательной валидности и индекс факториальной валидности. Подробнее о том, как рассчитать и интерпретировать эти показатели, см. в работах McKenzie et al. (1999) и Rubio et al. (2003). (Пример формы содержательной валидации см. в работе Gehlbach, Brinkworth, 2011.)
Наряду со сбором количественных данных, разработчики опросников должны предоставить экспертам возможность давать комментарии в свободной форме. Этот подход может быть особенно эффективен для изучения того, какие показатели или аспекты конструкта недостаточно хорошо представлены существующими вопросами. Данные, собранные на основании комментариев в свободной форме и последующего качественного анализа, часто позволяют получить информацию, которую не дают количественные данные, и могут привести к серьезным дополнениям к вопросам и шкалам (или исключениям из них) (McKenzie et al, 1999).
Существует множество способов анализа содержательной валидности нового опроса с помощью экспертной валидации. Оптимальный подход должен быть направлен на различные области, в которых исследователи испытывают наибольшие опасения по поводу шкалы (релевантности, ясности и т.д.) для каждого отдельного элемента и для каждого набора элементов или каждой шкалы. Количественные данные в сочетании с качественными данными экспертов призваны повысить содержательную валидность нового опросника или измерительной шкалы и в конечном счете эффективность инструмента опроса в целом.
ЭТАП VI. ПРОВЕДЕНИЕ КОГНИТИВНЫХ ИНТЕРВЬЮ
После того как эксперты помогли уточнить элементы шкалы, важно собрать доказательства валидности процесса предоставления ответов, чтобы оценить, как потенциальные участники интерпретируют ваши элементы и пункты ответов (AERA, APA & NCME 1999). Одним из способов сбора таких доказательств является процесс, известный под названием "когнитивное интервью" или "когнитивное предварительное тестирование" (Willis, 2005). Подобно тому как эксперты используются для определения содержательной валидности нового опроса, не менее важно определить, как потенциальные респонденты интерпретируют вопросы, и соответствует ли их интерпретация тому, что имеет в виду разработчик анкеты (Willis, 2005; Karabenick et al., 2007). Результаты когнитивных интервью могут быть полезны для выявления ошибок, которые респонденты допускают в своей интерпретации вопроса или вариантов ответа (Napoles-Springer et al., 2006; Karabenick et al., 2007). Как качественный метод, анализ опирается не на статистические проверки цифровых данных, а на кодирование и интерпретацию письменных заметок, сделанных в ходе проведения интервью. Таким образом, размеры выборки, используемой для когнитивного интервьюирования, обычно невелики и могут включать всего 10-30 участников (Willis, Artino, 2013). Для небольших исследовательских проектов в области медицинского образования может быть достаточно всего 5-6 участников, если разработчик опроса способен выявить потенциальную предвзятость в очень небольших выборках (Willis, Artino, 2013).
В когнитивном интервью используются методы психологии и традиционно предполагается, что, отвечая на вопросы, респонденты проходят через ряд когнитивных процессов. Эти этапы включают в себя понимание сути вопроса и выбор ответа, извлечение соответствующей информации из долговременной памяти, вынесение суждения, основанного на понимании вопроса и извлеченной из памяти информации, и, наконец, выбор ответа (Tourangeau et al., 2000). Поскольку респонденты могут испытывать трудности на любом этапе, когнитивное интервью следует разрабатывать и планировать так, чтобы все потенциальные проблемы были решены. Важным I этапом в процессе когнитивного интервью является создание критериев кодирования, отражающих предполагаемый смысл каждого вопроса (Karabenick et al., 2007), которые затем могут использоваться для интерпретации ответов, собранных в ходе когнитивного интервью.
Двумя основными методами проведения когнитивного интервью являются техника "думай вслух" и вербальное зондирование. Техника "думай вслух" требует от респондентов вербализации каждой мысли, которая приходит им в голову при ответе на каждый вопрос. В этом случае интервьюер просто поддерживает его действия, поощряя респондента продолжать говорить и записывать сказанное для последующего анализа (Willis, Artino, 2013). Этот метод может дать ценную информацию, но он, как правило, является неестественным и трудным для большинства респондентов, и это может привести к тому, что создатель опроса должен будет отбраковывать множество данных открытых ответов.
Дополнительная процедура - вербальное зондирование, - является более активной формой сбора данных, когда интервьюер задает серию зондирующих вопросов, предназначенных для получения конкретной информации (Willis, Artino, 2013) (список часто используемых вербальных зондов см. в табл. 4). Вербальное зондирование классически делится на параллельное и ретроспективное. При параллельном зондировании интервьюер задает респонденту конкретные вопросы о его мыслительных процессах, в то время как респондент отвечает на каждый вопрос. Параллельное зондирование, хотя и нарушает общий ход интервью, имеет то преимущество, что позволяет участникам отвечать на вопросы, пока их мысли свежи. Ретроспективное зондирование, с другой стороны, происходит после того, как участник завершил весь опрос (или часть опроса), и, как правило, в меньшей степени нарушает мыслительный процесс респондента, чем параллельное зондирование. Недостатком ретроспективного зондирования является риск смещения воспоминаний и ретроспективных эффектов (Drennan, 2003). Модификация двух методов вербального зондирования определяется как немедленное ретроспективное зондирование, которое позволяет интервьюеру найти естественные контрольные точки в опросе. Немедленное ретроспективное зондирование дает возможность интервьюеру провести исследование, не прерываясь между каждым пунктом (Watt et al., 2008). Этот подход имеет потенциальное преимущество, заключающееся в уменьшении предвзятости воспоминаний и ретроспективных эффектов при одновременном ограничении числа прерываний респондента со стороны интервьюера и снижении искусственности процесса. На практике во многих когнитивных интервью на самом деле используется комбинация методов "думай вслух" и вербального зондирования с целью более эффективного выявления потенциальных ошибок.
Таблица 4. Примеры широко используемых вербальных зондов
)
Адаптировано с разрешения журнала Journal of Graduate Medical Education: Willis G.B., Artino A.R. Jr. What do our respondents think we’re asking? Using cognitive interviewing to improve medical education surveys. J Grad Med Educ. 2013; 5: 353-6.
После завершения когнитивного интервью проводится анализ полученных качественных данных. Существует несколько методов анализа. Одним из методов количественного анализа результатов когнитивного интервью является кодирование. Этот метод состоит в том, что для распространенных ошибок респондентов (например, респондент запрашивает разъяснения) устанавливаются заранее определенные коды, и по каждому вопросу количество ошибок каждого типа заносится в таблицу (Napoles-Springer et al., 2006). Кроме того, коды могут ранжироваться в соответствии с заранее определенной степенью серьезности ошибки. Хотя количественные результаты этого анализа часто легко интерпретируются, при использовании этого метода можно пропустить ошибки, которые трудно предсказать. Кроме того, он не позволяет полностью объяснить, почему возникает ошибка (Napoles-Springer et aL., 2006). К тому же к когнитивному интервью также может применяться качественный подход посредством анализа взаимодействия. Как правило, анализ взаимодействия пытается описать и объяснить способы, которыми люди интерпретируют ответы и взаимодействуют во время разговора, и этот метод может применяться в ходе когнитивного интервью для определения смысла ответов (Napoles-Springer et al., 2006). Исследования показали, что сочетание кодирования и анализа взаимодействия может быть достаточно эффективным и предоставляет больше информации о "когнитивной валидности" нового опросника (Napoles-Springer et al., 2006).
Важность сходного понимания респондентами каждого вопроса неразрывно связана с общей надежностью оценок любого нового опросника. Кроме того, необходимость понимания респондентами каждого вопроса так, как он был задуман создателем опроса, всецело обусловливает валидность опроса и выводов, которые могут быть сделаны на основании полученных данных. В совокупности эти два аспекта критически важны для создания качественного опросника, и каждый аспект может быть решен с помощью хорошо продуманного когнитивного интервью. В конечном счете независимо от методов, используемых для проведения когнитивных интервью и анализа данных, собранная информация должна использоваться для изменения и улучшения анкеты в целом и отдельных элементов опроса.
ЭТАП VII. ПРОВЕДЕНИЕ ПРОБНОГО АНКЕТИРОВАНИЯ ("ПИЛОТИРОВАНИЕ")
Несмотря на все усилия, предпринятые исследователями вопросов медицинского образования в ходе вышеупомянутого процесса разработки опроса, формулировка некоторых элементов анкеты все еще может быть некорректной (GehLbach, Brinkworth, 2011). Таким образом, следующим этапом являются пилотное тестирование опросника и продолжение сбора доказательств валидности. В основе двух наиболее распространенных подходов лежат его внутренняя структура и связи с другими переменными (AERA, APA & NCME, 1999). Во время пилотного тестирования участники целевой группы проходят опрос в заранее определенном формате (например, в онлайн- или бумажном формате). Затем данные, полученные в ходе пилотного теста, анализируются для оценки диапазона и вариантности вопросов, надежности всей шкалы и корреляций вопросов и суммарных баллов. На этом этапе разработчики опросов должны также изучить описательную статистику (например, средние значения и стандартные отклонения) и гистограммы, которые демонстрируют распределение ответов по вопросам. Этот анализ может помочь в выявлении элементов, которые могут функционировать не так, как предполагал разработчик.
Для определения внутренней структуры опросника и оценки степени, в которой элементы в рамках конкретной шкалы измеряют единый базовый конструкт (т.е. одномерность шкалы), разработчикам опросов следует рассмотреть возможность использования передовых статистических методов, таких как факторный анализ. Факторный анализ - это статистическая процедура, предназначенная для оценки "количества различных конструктов, необходимых для учета схемы корреляций в наборе показателей" (Fabriger, Wegener, 2012, с. 3). Чтобы оценить размерность шкалы опроса, которая была целенаправленно построена для оценки одного конструкта (например, с использованием процессов, описанных в этом исследовании), мы рекомендуем использовать методы подтверждающего факторного анализа. В то же время другие ученые утверждают, что при оценке новых шкал целесообразнее применять исследовательский факторный анализ (McCoach et al., 2013). Независимо от конкретного применяемого анализа исследователи должны знать, что методы факторного анализа зачастую плохо изучены и плохо реализуются. К счастью, литература изобилует многими полезными руководствами (см., например, Pett et al., 2003; McCoach et aL., 2013).
Проведение анализа надежности - еще один важный шаг на этапе пилотного тестирования. Наиболее распространенный способ оценки надежности шкалы - вычисление коэффициента "альфа Кронбаха". Альфа Кронбаха - это мера внутренней согласованности оценок элементов (т.е. степень, в которой оценки отдельных элементов на шкале коррелируют друг с другом). Это функция корреляции между пунктами и общим количеством пунктов по определенной шкале. Важно отметить, что альфа Кронбаха не является хорошим показателем одномерности шкалы (измерение единого концепта), как часто предполагается (Schmitt, 1996). Таким образом, в большинстве случаев разработчики исследования должны сначала провести факторный анализ, чтобы оценить одномерность шкалы, а затем приступить к анализу надежности, чтобы оценить внутреннюю согласованность элементов шкалы (Schmitt, 1996).
Поскольку альфа Кронбаха чувствительна к длине шкалы, при прочих равных условиях более длинная шкала в большинстве случаев будет характеризоваться более высоким значением коэффициента альфа Кронбаха. Безусловно, длину шкалы и связанное с этим повышение надежности внутренней согласованности следует соизмерять с чрезмерной нагрузкой респондентов и сопутствующими ошибками в ответах, которые могут возникнуть, когда опросники становятся слишком длинными и респонденты устают. Наконец, крайне важно признать, что надежность - необходимое, но недостаточное условие валидности (AERA, APA & NCME, 1999). Другими словами, для того, чтобы результаты опроса считались достоверными, они должны быть в первую очередь надежными. Однако надежные оценки не обязательно являются достоверными для данной цели.
После оценки одномерности и внутренней согласованности шкалы разработчики опросов часто формируют суммарные баллы для каждой шкалы. В зависимости от рассматриваемого вопроса исследования суммарные баллы могут затем использоваться в качестве независимых или зависимых переменных. При попытке оценить трудноизмеримые образовательные конструкты, такие как мотивация, уверенность и удовлетворенность, обычно имеет смысл создать суммарный балл для каждой шкалы опроса, чем использовать отдельные элементы опроса в качестве переменных (Sullivan, Artino, 2013). Суммарный балл - это просто средняя оценка (взвешенная или невзвешенная) всех элементов в пределах определенной шкалы. Использование средних оценок имеет несколько явных преимуществ по сравнению с суммированием элементов в рамках определенной шкалы или подшкалы. Во-первых, средние оценки обычно выводятся с использованием той же шкалы ответов, что и для отдельных элементов. Этот подход способствует прямой интерпретации средних оценок с точки зрения ответов. Во-вторых, использование средних оценок позволяет понять, насколько велики (или малы) измеряемые различия на самом деле при сравнении отдельных лиц или групп. Как предупреждал Колливер и соавт. (Colliver et al., 2010), "суммы рейтинговых оценок отражают как рейтинговые оценки, так и количество элементов, что увеличивает различия между оценками и делает различия более важными, чем они есть" (стр. 591).
После создания суммарных баллов для каждой шкалы опроса полученные переменные могут быть изучены для определения их отношения к другим переменным, которые были собраны. Цель этого шага - определить, согласуются ли взаимосвязи переменных с теорией и предыдущими исследованиями. Так, например, можно было бы ожидать, что суммарные баллы по шкале, предназначенной для оценки уверенности обучающихся в своих навыках наложения швов, будут положительно коррелировать с количеством успешных выполненных процедур наложения швов (так как практика укрепляет уверенность) и отрицательно коррелировать с тревожностью, связанной с процедурой (так как более уверенные в себе обучающиеся также демонстрируют меньший уровень тревожности). Таким образом, разработчики опросов оценивают валидность созданных ими шкал с точки зрения их взаимосвязи с другими переменными (AERA, APA & NCME, 1999). Стоит отметить, что в приведенном выше примере разработчик опроса оценивает корреляции между вновь разработанными оценками шкалы и как объективной мерой (количество процедур), так и субъективной мерой (баллы по шкале тревожности). Оба эти подхода целесообразны для оценки взаимосвязи новой шкалы с другими переменными.
Глоссарий
■ Закрытый вопрос - вопрос анкеты с конечным числом категорий ответов, из которых респондент может выбрать вариант.
■ Когнитивное интервьюирование (или когнитивное предварительное тестирование) - основанный на фактических данных качественный метод, специально предназначенный для исследования того, удовлетворяет ли вопрос анкеты его предполагаемой цели.
■ Параллельное зондирование - метод вербального зондирования, при котором интервьюер задает зондирующий вопрос сразу же после того, как респондент прочитал вслух каждый вопрос анкеты и ответил на него.
■ Конструкт - гипотетическое понятие или характеристика (нечто "сконструированное"), для измерения которых предназначен опрос или тест. Исторически сложилось так, что термин "конструкт" был зарезервирован для обозначения характеристик, которые не могут наблюдаться непосредственно. Однако в последнее время этот термин получил более широкое определение.
■ Содержательная валидность - доказательство, полученное в результате анализа взаимосвязи между содержанием инструмента опроса и конструктом, который он призван измерять.
■ Факторный анализ - набор статистических процедур, предназначенных для оценки количества различных конструктов, необходимых для учета схемы корреляций в наборе показателей.
■ Открытый вопрос - вопрос анкеты, который требует от респондентов ответа в свободной форме (например, число, список или более длинный, развернутый ответ).
■ Надежность - степень, в которой оценки, полученные с помощью конкретной процедуры измерения или инструмента (например, опроса), являются последовательными и воспроизводимыми. Надежность - необходимое, но недостаточное условие валидности.
■ Якоря ответов - пункты, указанные в ряду вариантов ответа (например, абсолютно неважно, не очень важно, в меру важно, довольно важно и чрезвычайно важно).
■ Валидность процесса предоставления ответа - доказательство валидности, полученное в результате анализа того, как респонденты интерпретируют значение конкретных пунктов измерительной шкалы.
■ Ретроспективное зондирование - метод вербального зондирования, при котором интервьюер задает зондирующие вопросы после того, как респондент завершил весь опрос (или часть опроса).
■ Шкала - два или более элементов, предназначенных для измерения конструкта.
■ Интервьюирование по методу "думай вслух" - когнитивный метод интервьюирования, при котором респондентов просят активно вербализовать свои мысли, когда они пытаются ответить на оцениваемые вопросы анкеты.
■ Валидность - степень, в которой предлагаемые интерпретации оценок инструмента подтверждаются данными и теорией.
■ Аргументация валидности - процесс накопления доказательств с целью обеспечения надежной научной основы для предлагаемого использования оценок инструмента.
■ Вербальное зондирование - когнитивный метод интервьюирования, при котором интервьюер задает серию зондирующих вопросов, специально предназначенных для получения подробной информации, выходящей за рамки обычно предоставляемой респондентами.
■ Заявление о наличии/отсутствии заинтересованности. Некоторые авторы являются военнослужащими. Параграф 105 раздела 17 Свода федеральных законов США предусматривает, что "защита авторских прав в соответствии с данным разделом недоступна для работ сотрудников правительства Соединенных Штатов". Параграф 101 раздела 17 Свода федеральных законов США определяет работу сотрудника правительства Соединенных Штатов как работу, подготовленную военнослужащим или служащим правительства Соединенных Штатов в рамках своих служебных обязанностей.
ЗАКЛЮЧЕНИЕ
В этом руководстве AMEE представлен систематический 7-этапный процесс разработки шкал опроса. Следует отметить, что многие важные темы, связанные с организацией и проведением опросов, выходят за рамки нашей статьи, посвященной разработке шкал, и поэтому не обсуждались в данном руководстве. Эти темы включают, помимо прочего, одобрение анкет для научных исследователей с этической точки зрения, формат опроса (бумажный или электронный), методы определения выборки, получение высоких показателей ответов, предоставление стимулов и управление данными. Эти и многие другие темы подробно рассматриваются в других источниках (например, DiUman et al, 2009). Мы также признаем, что представленная здесь методология не является единственным способом разработки и создания высококачественного опросника. Однако мы надеемся, что, читая это руководство, исследователи вопросов медицинского образования придут к пониманию важности следования системному, основанному на доказательствах подходу к разработке анкет. Это не только повышает качество опросников, используемых в медицинском образовании, но и потенциально может положительно повлиять на общее качество исследований в области медицинского образования, авторы значительной части которых используют анкетирование.
Взгляды, выраженные в этой статье, принадлежат авторам и не обязательно отражают официальную позицию Военно-медицинского университета, Военно-морского флота США, Вооруженных сил США, Военно-воздушных сил США или Министерства обороны.
Фрагменты настоящего руководства AMEE были ранее опубликованы в журнале "Journal of Graduate Medical Education and Academic Medicine" и используются с прямого разрешения издателей (Gehlbach et al., 2010; Artino et al., 2011; Artino, Gehlbach, 2012; Rickards et al., 2012; Magee et al., 2013; Willis, Artino, 2013).
References/Литература
- American Educational Research Association (AERA), American Psychological Association (APA) & National Council on Measurement in Education (NCME). Standards for education and psychological testing. Washington, DC: American Educational Research Association, 1999.
- Artino A.R., Gehlbach H., Durning S.J. AM last page: Avoiding five common pitfalls of survey design. Acad Med. 2011; 86: 1327.
- Artino A.R., Gehlbach H. AM last page: avoiding four visual design pitfalls in survey development. Acad Med. 2012; 87: 1452.
- Beck C.T., Gable R.K. Ensuring content validity: An illustration of the process. J Nurs Meas. 2001; 9: 201-15.
- Christian L.M., Parsons N.L., Dillman D.A. Designing scalar questions for web surveys. Sociol Method Res. 2009; 37: 393-425.
- Colliver J.A., Conlee M.J., Verhulst S.J., Dorsey J.K. Reports of the decline of empathy during medical education are greatly exaggerated: a reexamination of the research. Acad Med. 2010; 85: 588-93.
- Cook D.A., Beckman T.J. Current concepts in validity and reliability for psychometric instruments: theory and application. Am J Med. 2006; 119: 166.e7-16.
- DeVellis R.F. Scale development: theory and applications. 2nd ed. Newbury Park, CA: Sage, 2003.
- Dillman D., Smyth J., Christian L. Internet, mail, and mixed-mode surveys: the tailored design method. 3rd ed. Hoboken, NJ: Wiley, 2009.
- Drennan J. Cognitive interviewing: verbal data in the design and pretesting of questionnaires. J Adv Nurs. 2003; 42 (1): 57-63.
- Fabrigar L.R., Wegener D.T. Exploratory factor analysis. New York: Oxford University Press, 2012.
- Fowler FJ. Survey research methods. 4th ed. Thousand Oaks, CA: Sage, 2009.
- Gehlbach H., Artino A.R., Durning S. AM last page: survey development guidance for medical education researchers. Acad Med. 2010; 85: 925.
- Gehlbach H., Brinkworth M.E. Measure twice, cut down error: a process for enhancing the validity of survey scales. Rev Gen Psychol. 2011; 15: 380-7.
- Kane M.T. Validation in educational measurement. 4th ed. Westport, CT: American Council on Education/Praeger, 2006.
- Karabenick S.A., Woolley M.E., Friedel J.M., Ammon B.V., Blazevski J., Bonney C.R., et al. Cognitive processing of self-report items in educational research: do they think what we mean? Educ Psychol. 2007; 42 (3): 139-51.
- Krosnick J.A. Survey research. Annu Rev Psychol. 1999; 50: 537-67.
- Magee C., Byars L., Rickards G., Artino A.R. Tracing the steps of survey design: a graduate medical education research example. J Grad Med Educ. 2013; 5 (1): 1-5.
- McCoach D.B., Gable R.K., Madura J.P. Instrument development in the affective domain: school and corporate applications. 3rd ed. New York: Springer, 2013.
- McIver J.P., Carmines E.G. Unidimensional scaling. Beverly Hills, CA: Sage, 1981.
- McKenzie J.F., Wood M.L., Kotecki J.E., Clark J.K., Brey R.A. Establishing content validity: Using qualitative and quantitative steps. Am J Health Behav. 1999; 23 (4): 311-8.
- Napoles-Springer A.M., Olsson-Santoyo J., O’Brien H., Stewart A.L. Using cognitive interviews to develop surveys in diverse populations. Med Care. 2006; 44 (11): s21-30.
- Pett M.A., Lackey N.R., Sullivan J.J. Making sense of factor analysis: the use of factor analysis for instrument development in health care research. Thousand Oaks, CA: Sage, 2003.
- Polit D.F., Beck C.T. Nursing research: principles and methods. 7th ed. Philadelphia: Lippincott Williams and Wilkins, 2004.
- Polit D.F., Beck C.T. The content validity index: are you sure you know what’s being reported? Critique and recommendations. Res Nurs Health. 2006; 29: 489-97.
- Rickards G., Magee C., Artino A.R. You can’t fix by analysis what you’ve spoiled by design: developing survey instruments and collecting validity evidence. J Grad Med Educ. 2012; 4 (4): 407-10.
- Rubio D.M., Berg-Weger M., Tebb S.S., Lee E.S., Rauch S. Objectifying content validity: Conducting a content validity study in social work research. Soc Work Res. 2003; 27 (2): 94-104.
- Schmitt N. Uses and abuses of coefficient alpha. Psychol Assess. 1996; 8: 350-3.
- Schwarz N. Self-reports: How the questions shape the answers. Am Psychol. 1999; 54: 93-105.
- Sullivan G. A primer on the validity of assessment instruments. J Grad Med Educ. 2011; 3 (2): 119-20.
- Sullivan G.M., Artino A.R. Analyzing and interpreting data from Likerttype scales. J Grad Med Educ. 2013; 5 (4): 541-2.
- Tourangeau R., Rips L.J., Rasinski K.A. The psychology of survey response. New York: Cambridge University Press, 2000.
- Waltz C.F., Strickland O.L., Lenz E.R. Measurement in nursing and health research. 3rd ed. New York: Springer, 2005.
- Watt T., Rasmussen A.K., Groenvold M., Bjorner J.B., Watt S.H., Bonnema S.J., et al. Improving a newly developed patient-reported outcome for thyroid patients, using cognitive interviewing. Qual Life Res. 2008; 17: 1009-17.
- Weng L.J. Impact of the number of response categories and anchor labels on coefficient alpha and test-retest reliability. Educ Psychol Meas. 2004; 64: 956-72.
- Willis G.B., Artino A.R. What do our respondents think we’re asking? Using cognitive interviewing to improve medical education surveys. J Grad Med Educ. 2013; 5 (3): 353-6.
- Willis G.B. Cognitive interviewing: a tool for improving questionnaire design. Thousand Oaks, CA: Sage, 2005.