Короткая версия: уровень строится не на одном ответе, дата — не обещание, а прогресс нельзя «нарисовать». Ниже — как это устроено и где границы метода.
Тест адаптивный: каждое следующее задание выбирается там, где вероятность твоего успеха ≈ 50% — именно там граница умения. Оценка уровня — байесовская (модель IRT, стандарт компьютерного тестирования): после каждого ответа уточняется распределение по шкале A1–C2 отдельно для грамматики, лексики и понимания/письма. Пока данных мало, мы показываем «?» рядом с уровнем — это не украшение, а реальная ширина неопределённости.
Ответы оценивает языковая модель по строгой рубрике. Мы проверили её вслепую на корпусе MERLIN — это открытый набор из 1000+ реальных экзаменационных работ по немецкому, каждая оценена профессиональными экзаменаторами по CEFR:
Каппа 0.86 (квадратично-взвешенная) — это диапазон, в котором согласуются между собой два независимых эксперта-человека. То есть наш оценщик спорит с экзаменаторами не чаще, чем они спорят друг с другом.
Справедливый вопрос. Три защиты: (а) уровень никогда не строится на одном ответе — только на десятках проб; (б) тема считается выученной не в момент ответа, а после отсроченной проверки — новым заданием через несколько дней; (в) в конце каждого спринта — замер цели отдельным заданием без подсказок. Нарисовать прогресс в такой схеме можно только одним способом — реально выучив.
Из трёх величин: сколько часов реально требует переход между уровнями (якоря — учебные нормы Goethe-Institut, ~160–250 часов на уровень), твоя выбранная нагрузка (минуты × дни, с честным дисконтом за длинные сессии — отдача падает) и твой измеренный темп по закрытым темам. Поэтому дата всегда показывается с вилкой: «≈ 6 мес (вилка 5–8)». Вилка сужается по мере накопления твоих данных и двигается в обе стороны — быстрее занимаешься, дата приближается.