Доступ к рынку и коммерциализация

Потребительские тесты концепций и A/B-эксперименты

Ограничения потребительского исследования: гипотетическое смещение при декларируемом предпочтении, невероятностные онлайн-панели, необходимый размер выборки в A/B-тесте и почему подглядывание в незавершённый эксперимент разрушает его уровень ошибки.

Потребительское исследование и обученную сенсорную панель нередко ведёт одно и то же агентство, и их постоянно путают — хотя они отвечают на разные вопросы и упираются в разные ограничения. Тест на различение спрашивает, воспринимается ли разница вообще, и его статистика — та самая биномиальная арифметика, разобранная на странице о сенсорных панелях. Потребительское исследование спрашивает, выберут ли продукт, а эта величина не является перцептивной: это предсказание будущего поведения по нынешним высказываниям. Вся методическая трудность дисциплины вырастает из такой подмены.

Декларируемое предпочтение не равно проявленному

Разрыв между тем, сколько респондент готов заплатить на словах, и тем, сколько он платит на кассе, называют гипотетическим смещением, и это не шум, а систематический сдвиг в одну сторону. Готовность платить, полученная в опросе, устойчиво выше наблюдаемой в магазине просто потому, что высказывание ничего не стоит, а покупка стоит денег.

Сильнее всего смещение для социально одобряемых свойств — то есть ровно для «био», «переработанного», «без испытаний на животных» и «низкоуглеродного». Респондент отвечает в присутствии интервьюера и собственного представления о себе, поэтому тот самый признак, который продвигает продукт, заодно раздувает реакцию на него. Это и есть задокументированная форма разрыва между установкой и поведением в устойчивом потреблении, и наращивание выборки его не лечит: это смещение, а не дисперсия. Частичные средства известны — схемы, где выбор иногда становится обязывающим, вводные инструкции против «дешёвых слов», совместный анализ с принудительным размениванием признака на цену вместо изолированной оценки признака. Все они работают одним способом: делают ответ небесплатным.

Выборка — не население

Онлайн-панели невероятностны: респондент сам вступил в панель и был направлен в исследование. Квотирование выравнивает распределение по возрасту, региону и доходу, но не устраняет отбор по ненаблюдаемым переменным, а интерес к товарной категории — как раз такая переменная. Доверительный интервал в отчёте посчитан так, будто выборка случайна, поэтому он описывает только ошибку выборки и занижает полную ошибку на неизвестную величину. У фокус-групп та же беда в более жёсткой форме: участники слышат друг друга, ответы внутри группы не являются независимыми наблюдениями, и действительной единицей анализа оказывается группа, а не человек в ней.

Что A/B-тест решает, а что нет

Случайное распределение действительно даёт причинную идентификацию — внутри протестированной аудитории и периода. Плата за это арифметическая. Объём выборки, нужный для обнаружения эффекта, растёт примерно обратно квадрату его величины: вдвое меньший интересующий нас сдвиг требует вчетверо большего трафика. Поэтому малые абсолютные приросты на страницах с низкой конверсией часто необнаружимы за любое разумное время.

Два отказа встречаются постоянно. Множество одновременно проверяемых вариантов повышает вероятность, что хотя бы один окажется «значимым» случайно, если порог не поправлен. И наблюдение за идущим экспериментом с остановкой в момент пересечения порога полностью обесценивает p-значение, рассчитанное на фиксированный горизонт: каждый новый взгляд — ещё одна попытка пересечь его по удаче. Либо горизонт фиксируется заранее, либо применяется процедура, изначально рассчитанная на непрерывный контроль.

Наконец, хорошо протестированное утверждение может остаться незаконным. Предпочтение потребителя не является доказательством истинности, а в ЕС обоснованность заявления о пользе для здоровья решается отдельно и по тем доказательствам, которых требует EFSA.

Обновлено: