Редкость слова → IQ
Оценка IQ, при котором вероятность знать слово равна 50%. Русская реплика Word Rarity IQ калькулятора CognitiveMetrics: та же формула, частоты — корпус wordfreq для русского языка.
| Zipf | Частота, % | IQ | 95% ДИ | Перцентиль | |
|---|---|---|---|---|---|
| Лемма (вся парадигма) | |||||
| Введённая словоформа |
Кривая Раша: P(знает слово) от IQ
Как это работает
Частоты слов берутся из библиотеки wordfreq (тот же источник, что у оригинального калькулятора), корпус русского языка. Редкость слова переводится в IQ по эмпирической связи редкости с difficulty-параметром модели Раша (b) — у авторов оригинала корреляция r = −0.921. Параметр b — уровень способности, при котором вероятность знать слово равна 50%:
IQ = 190.5 − 25.5 · Zipf · 95% ДИ = IQ ± 11 · перцентиль = Φ((IQ − 100)/15)
Отличие от оригинала: в русском частотная масса слова размазана по падежам и числам, поэтому главная оценка считается по суммарной частоте всех словоформ леммы (иначе «вода» выглядела бы заметно реже, чем «water»). Оценка по введённой словоформе показана справочно. Ввод в любой форме («собаку», «бежала») автоматически лемматизируется (pymorphy3).
Ограничения
- Оценивается вербальный компонент (VCI), а не полный IQ; результат — вероятностная оценка, не измерение.
- Модель откалибрована на знаменательных словах (существительные, глаголы, прилагательные) и ломается на служебных («и», «не», «за» знают все).
- Ненадёжно для сленга и разговорных слов (их частота в письменном корпусе занижена) и для узкоспециальных терминов (их знание зависит от профессии, а не от объёма словаря).
- Наименее точно на краях распределения.
- Калибровка перенесена с английских данных: допущение, что связь «Zipf → b» одинакова для языков.