Развёрнутый отчёт по текущему этапу разработки русскоязычного философского LLM-бенчмарка¶
Отчёт составлен по стенограммам от 30.07, 31.07 и 01.08.2026 в хронологическом порядке, а численные результаты сверены с актуальными графиками и метриками репозитория HumanTech/phil-bench после обновления main.
1. Резюме исследования¶
На текущем этапе создан и технически проверен воспроизводимый контур русскоязычного философского LLM-бенчмарка. Он включает:
- русскоязычные философские источники и их смысловое разбиение на чанки;
- экспертные вопросы и эталонные ответы;
- ответы нескольких языковых моделей в коротком и длинном режимах;
- оценивание ответов специализированной моделью-судьёй POLLUX;
- независимое оценивание моделью-судьёй GLM-5.2;
- сопоставление автоматических оценок с человеческими;
- анализ различающей способности критериев;
- отдельный детерминированный контроль лексических и языковых дефектов;
- формирование производного «золотого набора» из пяти наиболее информативных критериев.
Основной результат этапа состоит не в выборе окончательного победителя среди моделей-респондентов, а в установлении границ применимости автоматического судьи.
Исследование показало:
-
POLLUX нельзя использовать как автономного окончательного судью философских ответов. Его корреляция с экспертами на собственной восьмикритериальной архитектуре составляет r = 0,385.
-
Замена POLLUX на GLM-5.2 несколько повышает согласованность с людьми, хотя GLM-5.2 не проходила специализированного обучения на данном наборе критериев: r = 0,445.
-
Выбор модели-судьи существенно меняет результаты. Даже на одинаковых критериях POLLUX и GLM-5.2 по-разному используют шкалу и по-разному ранжируют ответы.
-
Большое количество критериев не гарантирует качество измерения. Половина критериев Article10 на полном наборе из 291 ответа оказалась полностью вырожденной: GLM-5.2 присвоила каждому ответу максимальный балл.
-
Длина ответа создаёт сильное систематическое смещение у POLLUX. Все шесть сопоставимых моделей получили за длинные ответы более высокие оценки, чем за короткие. Разрыв достигает 13,0 процентного пункта.
-
LLM-судья недостаточно надёжно распознаёт лексические дефекты и псевдотерминологию. Поэтому языковая корректность должна проверяться отдельным детерминированным слоем, а не растворяться в общей рубрике качества.
-
После применения отдельной дисквалификации ответы с языковыми дефектами перестают искусственно поднимать рейтинг моделей. Итоговый автоматический рейтинг становится существенно ближе к экспертному, особенно на крайних позициях.
Таким образом, наиболее обоснованная архитектура следующего этапа выглядит так:
философский источник → экспертный вопрос → эталонный ответ → ответ модели-респондента → детерминированная языковая проверка → оценивание по калиброванным критериям → сопоставление с экспертами → профиль ошибок и итоговый рейтинг
2. Исходная постановка задачи¶
2.1. Что именно должен измерять философский бенчмарк¶
Цель проекта — создать воспроизводимый русскоязычный бенчмарк для исследования философской компетентности больших языковых моделей.
Под философской компетентностью понимается способность модели:
- корректно работать с философскими понятиями;
- реконструировать позиции авторов и традиций;
- опираться на содержание источника;
- отличать описание позиции от её критики;
- строить связное философское рассуждение;
- отвечать на вопросы разных типов и уровней сложности;
- сохранять содержательную точность, а не только риторическую убедительность;
- использовать корректную русскоязычную философскую терминологию.
Бенчмарк не предназначен для определения «единственно правильной философии». Его задача практичнее: выяснить, насколько ответ модели соответствует экспертно заданному содержательному ориентиру и насколько система оценки способна отличить сильный ответ от слабого.
2.2. Разделение ролей¶
В эксперименте принципиально разделены три роли:
| Роль | Функция |
|---|---|
| Модель-респондент | Отвечает на философский вопрос. |
| Модель-судья | Оценивает ответ по заданным критериям. |
| Человек-эксперт | Формирует независимый ориентир для сравнения и содержательно интерпретирует ответы. |
Это разделение необходимо, потому что высокая оценка автоматического судьи сама по себе ещё не означает высокого качества ответа. Сначала требуется установить, насколько поведение судьи согласуется с человеческими оценками.
3. Данные и экспериментальная схема¶
3.1. Основной корпус ответов¶
Для сравнительных графиков использовался основной набор:
- 24 философских вопроса;
- 291 ответ моделей-респондентов;
- режимы short и long;
- шесть моделей с полным сопоставимым покрытием;
- дополнительная deepseek-v4-pro, представленная только тремя короткими ответами и исключённая из парного рейтинга.
Шесть полностью сопоставимых моделей:
- gpt-5.6-sol;
- glm-5.2;
- deepseek-v32;
- gpt-5.3-codex-spark;
- qwen3.6-35b-a3b;
- aliceai-llm.
Для каждой из этих шести моделей присутствуют:
- 24 коротких ответа;
- 24 длинных ответа;
- итого 48 ответов на модель;
- 288 полностью сопоставимых ответов.
3.2. Экспертный пакет для графиков 1.1–1.3¶
Для прямого сопоставления судей с экспертами использован пакет POLLUX8:
- 318 ответов с полными автоматическими оценками;
- 280 числовых экспертных оценок;
- экспертная шкала 1–5;
- автоматическая шкала каждого критерия 0–2;
- восемь критериев POLLUX: 1, 4, 5, 8, 10, 11, 12, 15.
Оценка автоматического судьи рассчитывалась как простое среднее восьми критериев без весов.
4. Интерпретация графиков¶
Раздел I. Согласованность моделей-судей с людьми¶
График 1.1. Экспертные оценки и POLLUX Judge¶
График сопоставляет:¶
- по оси X — экспертные оценки 1–5;
- по оси Y — средний результат POLLUX8, пересчитанный в шкалу 0–100;
- число пар — 280.
Ключевые показатели:
Корреляция Пирсона • Значение: 0,385
\(r^2\) • Значение: 0,148
Средняя экспертная оценка • Значение: 4,161 из 5
Средняя оценка POLLUX • Значение: 86,67 из 100
Стандартное отклонение экспертов • Значение: 0,960
Стандартное отклонение POLLUX • Значение: 10,405 п.п.
Интерпретация
Связь между оценками существует, но она недостаточна для автономного судьи.
r = 0,385 означает, что высокие экспертные оценки лишь отчасти сопровождаются высокими оценками POLLUX. Значительная часть вариативности человеческих суждений остаётся неотражённой.
POLLUX действительно различает некоторые ответы, но:
- плохо воспроизводит экспертный порядок;
- концентрирует оценки в сравнительно высокой части шкалы;
- не обладает достаточной разрешающей способностью;
- местами оценивает ответы выше, чем следует из экспертного результата.
Главный тезис графика:
Специализированный POLLUX Judge на собственном наборе критериев демонстрирует только ограниченную согласованность с человеческими экспертами. (3/10) Это не означает, что оценки POLLUX полностью случайны. Но корреляция недостаточна, чтобы считать его надёжной заменой экспертной проверке.
График 1.2. Экспертные оценки и GLM-5.2¶
На том же экспертном подмножестве и по тем же восьми критериям POLLUX был заменён на GLM-5.2.
Число пар • Значение: 280
Корреляция Пирсона • Значение: 0,445
\(r^2\) • Значение: 0,198
Средняя экспертная оценка • Значение: 4,161 из 5
Средняя оценка GLM-5.2 • Значение: 82,77 из 100
Стандартное отклонение GLM-5.2 • Значение: 9,326 п.п.
Интерпретация
GLM-5.2 показывает более высокую корреляцию с экспертами:
- POLLUX: 0,385;
- GLM-5.2: 0,445.
Разница не доказывает окончательного превосходства GLM-5.2. Обе величины всё ещё находятся далеко от уровня, достаточного для надёжного автономного оценивания.
Но результат методологически важен:
Современная универсальная модель, получившая критерии в виде обычной текстовой инструкции, согласуется с экспертами несколько лучше специализированного судьи.
Это ставит под вопрос:
- достаточность специализированного обучения POLLUX;
- переносимость его критериев на философскую предметную область;
- целесообразность выбора POLLUX как основной judge-модели без дополнительной калибровки.
При этом оценки GLM-5.2 ещё более сжаты: стандартное отклонение ниже, чем у POLLUX. Следовательно, небольшое повышение согласованности с людьми не решает проблему недостаточной различающей способности.
График 1.3. Согласованность POLLUX и GLM-5.2 между собой¶
График сравнивает двух автоматических судей на том же подмножестве из 280 ответов.¶
Корреляция Пирсона • Значение: 0,589
Среднее POLLUX • Значение: 86,67
Среднее GLM-5.2 • Значение: 82,77
Средняя абсолютная разница • Значение: 7,43 п.п.
Среднее смещение GLM − POLLUX • Значение: −3,91 п.п.
Из 280 ответов:
- GLM-5.2 поставила выше POLLUX — 53;
- оценки совпали — 71;
- GLM-5.2 поставила ниже POLLUX — 156.
Интерпретация
Судьи согласуются друг с другом заметно сильнее, чем каждый из них — с экспертами. Это важное наблюдение.
Оно означает, что автоматические судьи могут разделять общую «машинную оптику»:
- одинаково реагировать на структуру и стиль;
- использовать сходные шаблоны оценивания;
- быть чувствительными к формальным признакам ответа;
- одновременно пропускать содержательные дефекты, которые замечают люди.
Поэтому высокая согласованность двух LLM-судей не может служить заменой человеческой калибровке.
5. Различающая способность критериев¶
График 2.1. Вариативность восьми критериев POLLUX¶
График построен по 291 ответу. Критерии ранжированы по стандартному отклонению.¶
1 • Критерий: Креативность • Среднее: 0,907 • \(\sigma\): 0,675 • Диапазон: 0–2
2 • Критерий: Полезность • Среднее: 1,515 • \(\sigma\): 0,500 • Диапазон: 1–2
3 • Критерий: Формальный учёт требований • Среднее: 1,557 • \(\sigma\): 0,497 • Диапазон: 1–2
4 • Критерий: Доступность • Среднее: 1,584 • \(\sigma\): 0,493 • Диапазон: 1–2
5 • Критерий: Отсутствие артефактов • Среднее: 1,601 • \(\sigma\): 0,490 • Диапазон: 1–2
6 • Критерий: Глубина проработки • Среднее: 1,670 • \(\sigma\): 0,470 • Диапазон: 1–2
7 • Критерий: Естественность речи • Среднее: 1,082 • \(\sigma\): 0,275 • Диапазон: 1–2
8 • Критерий: Непротиворечие фактам • Среднее: 1,955 • \(\sigma\): 0,207 • Диапазон: 1–2
Интерпретация
POLLUX не использует шкалу равномерно.
- Креативность обеспечивает основную вариативность.
- Пять критериев дают умеренное разделение, но не используют нулевую часть шкалы.
- Естественность речи различает ответы слабо.
- Непротиворечие фактам почти вырождено у максимума.
Для философского бенчмарка это создаёт две проблемы.
Первая проблема: доминирование креативности
Креативность — центральный источник различения у POLLUX, но для академического философского ответа это не обязательно ключевой показатель.
Креативный ответ может быть:
- оригинальным, но неточным; (4/10)
- риторически сильным, но источниково необоснованным;
- убедительным, но приписывающим автору чужую позицию.
Вторая проблема: сжатие остальных критериев
По семи критериям почти отсутствуют нулевые оценки. Следовательно, судья редко маркирует ответ как существенно несостоятельный даже в тех случаях, когда эксперты находят серьёзные недостатки.
График 2.2. Вариативность POLLUX8 при использовании GLM-5.2¶
Те же восемь критериев были переданы GLM-5.2.
1 • Критерий: Глубина проработки ответа • Среднее: 1,567 • \(\sigma\): 0,548 • Диапазон: 0–2
2 • Критерий: Естественность и несинтетичность речи • Среднее: 1,811 • \(\sigma\): 0,449 • Диапазон: 0–2
3 • Критерий: Полезность • Среднее: 1,784 • \(\sigma\): 0,412 • Диапазон: 1–2
4 • Критерий: Отсутствие артефактов • Среднее: 1,928 • \(\sigma\): 0,284 • Диапазон: 0–2
5 • Критерий: Непротиворечие фактам • Среднее: 1,955 • \(\sigma\): 0,238 • Диапазон: 0–2
6 • Критерий: Формальный учёт требований • Среднее: 1,945 • \(\sigma\): 0,228 • Диапазон: 1–2
7 • Критерий: Креативность • Среднее: 0,034 • \(\sigma\): 0,200 • Диапазон: 0–2
8 • Критерий: Доступность • Среднее: 1,983 • \(\sigma\): 0,130 • Диапазон: 1–2
Интерпретация
GLM-5.2 полностью меняет профиль тех же критериев.
Наиболее показательный пример — креативность:
- POLLUX: среднее 0,907, $\sigma = 0,675;
- GLM-5.2: среднее 0,034, $\sigma = 0,200.
Из 291 ответа GLM-5.2 поставила по креативности:
- 0 — 282 ответам;
- 1 — 8 ответам;
- 2 — одному ответу.
То, что для POLLUX было главным источником дифференциации, для GLM-5.2 оказалось почти неработающим критерием.
Это доказывает:
Критерий не существует отдельно от модели-судьи. Одинаковая текстовая рубрика не гарантирует одинакового измерительного поведения.
При этом содержательно более естественные для философской оценки критерии — глубина проработки и естественность речи — у GLM-5.2 начинают использовать более широкий диапазон.
График 2.3. Вариативность десяти критериев Article10 при использовании GLM-5.2¶
Следующим шагом GLM-5.2 была проверена на десяти критериях, сформулированных предыдущей командой для статьи.
Глубина философского анализа • Среднее: 1,701 • \(\sigma\): 0,494
Философская точность • Среднее: 1,852 • \(\sigma\): 0,400
Источниковая обоснованность • Среднее: 1,928 • \(\sigma\): 0,259
Эпистемическая осторожность • Среднее: 1,962 • \(\sigma\): 0,239
Риторическая уместность • Среднее: 1,979 • \(\sigma\): 0,142
Логическая связность • Среднее: 2,000 • \(\sigma\): 0,000
Информационная плотность • Среднее: 2,000 • \(\sigma\): 0,000
Отсутствие предвзятости • Среднее: 2,000 • \(\sigma\): 0,000
Структурная полнота рассуждения • Среднее: 2,000 • \(\sigma\): 0,000
Валидность переходов • Среднее: 2,000 • \(\sigma\): 0,000
Главный результат
Пять из десяти критериев не различили ни одного ответа.
Каждый из 291 ответа получил максимальный балл по:
- логической связности;
- информационной плотности;
- отсутствию предвзятости;
- структурной полноте рассуждения;
- валидности переходов.
Это не дефект визуализации, а результат judge-run.
Почему более информативными оказались первые критерии
Глубина философского анализа и философская точность привязаны к содержанию ответа. Источниковая обоснованность также использует внешний ориентир.
Такие критерии можно сопоставить с:
- эталонным ответом;
- ключевыми тезисами;
- авторской позицией;
- содержанием источника;
- ожидаемыми ходами рассуждения.
Напротив, критерии вроде логической связности или структурной полноты могут вознаграждать почти любой грамотно организованный LLM-текст. Современные модели умеют создавать внешне связные ответы даже тогда, когда их философское содержание ошибочно.
Вывод раздела
Различающая способность возникает прежде всего там, где критерий имеет предметный якорь:
- источник;
- эталон;
- тезис;
- ожидаемую концептуальную структуру;
- содержательно проверяемую ошибку. (5/10) Общие критерии «хорошего текста» для современных моделей оказываются слишком мягкими.
6. Рейтинг моделей и влияние длины ответа¶
График 3.1. POLLUX8: длинные и короткие ответы¶
GLM-5.2 • Длинные: 80,2% • Короткие: 74,0% • Разница: −6,3 п.п.
Qwen 3.6 35B A3B • Длинные: 80,2% • Короткие: 74,0% • Разница: −6,3 п.п.
DeepSeek V3.2 • Длинные: 79,2% • Короткие: 69,3% • Разница: −9,9 п.п.
GPT-5.3 Codex Spark • Длинные: 78,6% • Короткие: 69,0% • Разница: −9,6 п.п.
GPT-5.6 SOL • Длинные: 78,4% • Короткие: 68,8% • Разница: −9,6 п.п.
AliceAI • Длинные: 76,6% • Короткие: 63,5% • Разница: −13,0 п.п.
Интерпретация
POLLUX систематически предпочитает длинные ответы:
- во всех шести случаях длинный режим получил более высокий результат;
- разрыв составляет от 6,3 до 13,0 процентного пункта;
- GPT-5.6 SOL, которую эксперты оценивали наиболее высоко, оказывается лишь на пятом месте по длинным ответам;
- GLM-5.2 и Qwen получают абсолютно одинаковые агрегированные оценки.
Это сильный сигнал длинового смещения.
POLLUX реагирует на объём и внешнюю развёрнутость ответа сильнее, чем требуется содержательному философскому бенчмарку.
После определённой длины ответ может получать высокий балл за наличие структуры, объяснений и формального покрытия критериев, даже если его содержательные преимущества не подтверждаются экспертами.
График 3.2. GLM-5.2 на критериях POLLUX8¶
GPT-5.6 SOL • Длинные: 84,9% • Короткие: 83,9% • Разница: −1,0 п.п.
GPT-5.3 Codex Spark • Длинные: 83,3% • Короткие: 82,8% • Разница: −0,5 п.п.
DeepSeek V3.2 • Длинные: 82,6% • Короткие: 80,7% • Разница: −1,8 п.п.
GLM-5.2 • Длинные: 82,3% • Короткие: 83,6% • Разница: +1,3 п.п.
AliceAI • Длинные: 79,7% • Короткие: 77,3% • Разница: −2,3 п.п.
Qwen 3.6 35B A3B • Длинные: 76,8% • Короткие: 77,6% • Разница: +0,8 п.п.
Интерпретация
У GLM-5.2 длиновое смещение значительно слабее:
- максимальный разрыв — 2,3 п.п.;
- у двух моделей короткие ответы даже получили более высокие оценки;
- GPT-5.6 SOL занимает первое место.
Это делает GLM-5.2 более подходящей основой для дальнейшей калибровки.
Но остаётся серьёзная проблема: GPT-5.3 Codex Spark находится на втором месте, хотя человеческие эксперты обнаруживали в её ответах выраженные языковые и терминологические дефекты.
Следовательно:
Содержательная LLM-рубрика не заменяет формальную проверку качества русскоязычного текста.
График 3.3. GLM-5.2 и «золотой набор» из пяти критериев¶
Для повышения содержательной релевантности был сформирован производный набор из пяти критериев:
- глубина философского анализа;
- философская точность;
- глубина проработки ответа;
- естественность и несинтетичность речи;
- источниковая обоснованность.
Формула:
golden_score = mean(пять оценок) / 2 × 100
Все критерии имеют одинаковый вес.
GPT-5.6 SOL • Длинные: 95,0% • Короткие: 89,6%
GPT-5.3 Codex Spark • Длинные: 91,7% • Короткие: 92,1%
GLM-5.2 • Длинные: 90,8% • Короткие: 90,8%
DeepSeek V3.2 • Длинные: 88,8% • Короткие: 88,3%
Qwen 3.6 35B A3B • Длинные: 86,7% • Короткие: 86,3%
AliceAI • Длинные: 85,4% • Короткие: 77,5%
Интерпретация
«Золотой набор» выводит GPT-5.6 SOL на первое место, что лучше соответствует экспертным наблюдениям.
Однако он не решает две проблемы.
Проблема 1. Оценки сжаты у верхней границы
Пять из шести моделей получают за длинные ответы более 85%. Различия между сильными и средними моделями остаются небольшими.
Такой рейтинг недостаточно устойчив к будущему улучшению моделей.
Проблема 2. Spark остаётся на втором месте
Модель с обнаруженными языковыми дефектами получает 91,7–92,1%. Значит, даже отобранные критерии не способны надёжно распознать специфический тип повреждённого русскоязычного ответа.
Это подтверждает необходимость отдельного контрольного слоя.
7. Детерминированный языковой контроль¶
7.1. Что проверяет отдельный слой¶
(6/10) Лексический критерий предназначен для выявления признаков, которые можно обнаружить без субъективной LLM-оценки:
- смешение кириллицы и латиницы внутри слов;
- чужие письменности в русскоязычном ответе;
- подозрительные несловарные леммы;
- неправильно образованные философские термины;
- сломанные словоформы.
На 291 ответе:
- 268 ответов прошли без штрафных признаков;
- 23 ответа содержали такие признаки;
- обнаружено 37 штрафных баллов:
- 13 — за mixed-script-вхождения;
- 24 — за леммы вне используемых словарей.
7.2. Почему это отдельный слой, а не шестой критерий¶
Если встроить языковой дефект в общую LLM-рубрику, модель-судья может:
- компенсировать ошибку высокими баллами по другим критериям;
- интерпретировать вымышленное слово как редкий термин;
- не заметить смешение визуально похожих символов;
- сохранить высокий итоговый балл содержательно повреждённому ответу.
Детерминированная проверка решает другую задачу: она устанавливает, допустим ли ответ к дальнейшему содержательному оцениванию.
График 3.4. «Золотой набор» с дисквалификацией¶
В актуальном репозитории правило реализовано не как линейный штраф ×50, а как более строгий сценарий дисквалификации:
если disqualification_points = 0: corrected_score = base_score
если disqualification_points > 0: corrected_score = 0
Правило применяется к каждому отдельному ответу до усреднения по модели.
GPT-5.6 SOL • Длинные до: 95,0% • Длинные после: 95,0% • Короткие до: 89,6% • Короткие после: 89,6%
DeepSeek V3.2 • Длинные до: 88,8% • Длинные после: 88,8% • Короткие до: 88,3% • Короткие после: 88,3%
GLM-5.2 • Длинные до: 90,8% • Длинные после: 87,1% • Короткие до: 90,8% • Короткие после: 90,8%
AliceAI • Длинные до: 85,4% • Длинные после: 85,4% • Короткие до: 77,5% • Короткие после: 73,8%
GPT-5.3 Codex Spark • Длинные до: 91,7% • Длинные после: 72,1% • Короткие до: 92,1% • Короткие после: 84,2%
Qwen 3.6 35B A3B • Длинные до: 86,7% • Длинные после: 50,4% • Короткие до: 86,3% • Короткие после: 77,1%
Интерпретация
Дисквалификация резко меняет положение двух моделей:
- Spark теряет 19,6 п.п. на длинных и 7,9 п.п. на коротких ответах;
- Qwen теряет 36,3 и 9,2 п.п. соответственно.
GPT-5.6 SOL и DeepSeek не теряют баллы.
Результат демонстрирует принципиальную полезность отдельного языкового слоя: он раскрывает различия, которые почти полностью скрывались в содержательном рейтинге GLM-5.2.
При этом дисквалификация любого ответа при единственном положительном признаке — исследовательский сценарий, а не окончательно откалиброванное правило. Перед эксплуатационным применением необходимо проверить ложноположительные срабатывания и сравнить несколько режимов:
- отдельная диагностическая метрика;
- мягкий линейный штраф;
- ступенчатый штраф;
- дисквалификация только при подтверждённой ошибке;
- обнуление отдельного ответа;
- исключение ответа из содержательной оценки с учётом доли успешно пройденных заданий.
8. График 4.1. Сопоставление итогового рейтинга с экспертами¶
Финальный график сравнивает:
- средние экспертные оценки, нормализованные из шкалы 1–5 в 0–100;
- единый рейтинг GLM-5.2 по «золотому набору»;
- величину, снятую дисквалификацией.
GPT-5.6 SOL • Экспертная оценка: 91,37% • Автоматическая после дисквалификации: 92,29% • Снято дисквалификацией: 0,00 п.п.
DeepSeek V3.2 • Экспертная оценка: 83,75% • Автоматическая после дисквалификации: 88,54% • Снято дисквалификацией: 0,00 п.п.
GLM-5.2 • Экспертная оценка: 80,86% • Автоматическая после дисквалификации: 88,96% • Снято дисквалификацией: 1,88 п.п.
AliceAI • Экспертная оценка: 80,65% • Автоматическая после дисквалификации: 79,58% • Снято дисквалификацией: 1,88 п.п.
GPT-5.3 Codex Spark • Экспертная оценка: 70,63% • Автоматическая после дисквалификации: 78,13% • Снято дисквалификацией: 13,75 п.п.
Qwen 3.6 35B A3B • Экспертная оценка: 57,01% (7/10) • Автоматическая после дисквалификации: 63,75% • Снято дисквалификацией: 22,71 п.п.
Экспертное покрытие различается:
- GPT-5.6 SOL — 42 оценки;
- DeepSeek V3.2 — 20;
- GLM-5.2 — 32;
- AliceAI — 42;
- Spark — 20;
- Qwen — 41.
Автоматический рейтинг построен на 48 ответах каждой модели.
Интерпретация
После дисквалификации крайние позиции экспертного и автоматического рейтингов совпадают:
- GPT-5.6 SOL — уверенное первое место;
- Qwen — последнее;
- Spark перемещается из группы формальных лидеров в нижнюю часть;
- AliceAI занимает промежуточную позицию;
- DeepSeek и GLM-5.2 образуют сильную среднюю группу.
Особенно важно почти точное совпадение по GPT-5.6 SOL:
- эксперты: 91,37%;
- автоматический рейтинг: 92,29%.
У AliceAI также наблюдается близость:
- эксперты: 80,65%;
- автоматический рейтинг: 79,58%.
По GLM-5.2, DeepSeek, Spark и Qwen автоматический рейтинг остаётся несколько завышенным. Тем не менее направление ранжирования значительно лучше соответствует экспертной картине, чем рейтинг без языкового контроля.
Главный вывод:
На текущей выборке сочетание содержательной LLM-оценки и отдельной детерминированной проверки даёт более правдоподобный рейтинг, чем любая из этих процедур по отдельности.
9. Основные научные выводы¶
9.1. POLLUX не подтверждён как автономный судья¶
Наиболее благоприятный для POLLUX сценарий — его собственные восемь критериев и полный экспертный пакет — дал корреляцию 0,385.
Это недостаточно для:
- автономной публикации итогового лидерборда;
- замены экспертов;
- признания автоматического балла объективной мерой философской компетентности.
Практическим достоинством POLLUX остаются скорость и потенциально более низкая стоимость массовой оценки. Но это преимущество относится к производительности, а не к доказанной валидности.
9.2. GLM-5.2 — более перспективная, но ещё не откалиброванная основа¶
GLM-5.2:
- лучше согласуется с экспертами на POLLUX8;
- меньше зависит от длины ответа;
- более правдоподобно ставит GPT-5.6 SOL на первое место;
- лучше различает глубину и естественность речи.
Но она:
- сжимает оценки;
- завышает результаты большинства современных моделей;
- полностью обнуляет различающую способность половины Article10-критериев;
- пропускает лексические дефекты;
- не может пока использоваться автономно.
9.3. Критерии должны быть предметно проверяемыми¶
Работающий философский критерий должен иметь хотя бы один внешний якорь:
- эталонный ответ;
- источник;
- набор обязательных тезисов;
- понятия, которые должны присутствовать;
- различение авторской позиции и критики;
- формализованные типы фактических и интерпретационных ошибок.
Чем абстрактнее критерий, тем выше вероятность, что современная модель получит по нему максимальный балл просто за грамотно организованный текст.
9.4. Языковая исправность — условие допуска, а не часть общего впечатления¶
Искажённый термин или смешение письменностей может разрушить смысл философского ответа. Поэтому языковой контроль должен быть выделен в отдельный слой.
При этом необходимо различать:
- корректный редкий философский термин;
- допустимую историческую словоформу;
- необычную, но существующую лемму;
- явную галлюцинацию;
- техническое повреждение слова;
- ошибочное смешение письменностей.
Без этого возникает риск ложноположительных срабатываний.
9.5. Человеческие эксперты остаются необходимыми¶
Эксперты нужны минимум для четырёх задач:
- формулирования вопросов;
- создания эталонных ответов;
- разработки содержательных критериев;
- калибровки модели-судьи и языковых санкций.
Автоматизация не устраняет экспертный труд. Она позволяет использовать его эффективнее: не проверять вручную каждую атомарную оценку, а задавать и проверять измерительный контур.
10. Ограничения текущего этапа¶
10.1. Корпус ещё не является полностью экспертно подтверждённым датасетом¶
В репозитории содержится:
- 631 паспортированный чанк-кандидат; (8/10)
- 215 чанков со статусом done;
- 416 со статусом draft.
Статус draft означает отсутствие завершённой экспертной проверки. Поэтому 631 чанк нельзя представлять как окончательно валидированный датасет.
10.2. Экспертные оценки имеют неравное покрытие¶
В графике 4.1 число экспертных оценок по моделям составляет от 20 до 42. Следовательно:
- средние имеют разную статистическую устойчивость;
- сравнение середины рейтинга остаётся предварительным;
- крайние позиции интерпретируются увереннее, чем небольшие различия между соседними моделями.
10.3. Текущая выборка моделей смещена в сторону сильных систем¶
Пять из шести основных моделей являются современными и сравнительно сильными. Это естественно сдвигает распределения к верхней границе.
Для проверки полного диапазона критериев необходимы:
- более слабые модели;
- модели разных размеров;
- модели разных поколений;
- заведомо повреждённые ответы;
- контролируемые контрпримеры;
- ответы с заранее внесёнными типами ошибок.
10.4. «Золотой набор» является производным исследовательским набором¶
Пять критериев выбраны по наблюдаемой информативности. Они ещё не прошли:
- независимую калибровку;
- проверку на отложенной выборке;
- проверку устойчивости к замене моделей-респондентов;
- проверку на других философских разделах;
- оценку взаимного дублирования.
Поэтому название «золотой набор» следует понимать как рабочее, а не как утверждение окончательной валидности.
10.5. Вес лексических санкций не откалиброван¶
В репозитории существуют сценарии ×10, ×20, ×50 и вариант полной дисквалификации. Они показывают чувствительность рейтинга, но пока не задают окончательную политику бенчмарка.
11. Рекомендации для следующего этапа¶
11.1. Расширить экспертную группу¶
Нужны не только преподаватели, привыкшие оценивать студенческие ответы, но и профильные специалисты по конкретным областям:
- истории философии;
- онтологии;
- эпистемологии;
- социальной и политической философии;
- философии техники;
- русской философии;
- современной континентальной и аналитической традиции.
Особенно важны эксперты, способные различать:
- хороший учебный ответ;
- профессионально точный ответ;
- выдающийся ответ уровня исследовательской дискуссии.
11.2. Пересмотреть шкалу оценивания¶
Современные модели уже часто отвечают лучше среднего студента, поэтому шкала, настроенная на учебные работы, может не различать верхнюю часть распределения.
Возможны два взаимодополняющих направления:
- расширение шкалы вверх — для различения хороших, отличных и выдающихся ответов;
- ужесточение нижних границ — чтобы единичная существенная ошибка заметно влияла на результат.
11.3. Проектировать критерии через контролируемые ошибки¶
Для каждого критерия целесообразно подготовить:
- эталонный ответ;
- хороший, но неполный ответ;
- риторически сильный, но ошибочный;
- точный, но слишком краткий;
- ответ с подменой авторской позиции;
- ответ с придуманным термином;
- ответ с фактической ошибкой;
- ответ с неуместным контраргументом;
- ответ с правильными словами, но неправильной логикой.
Это позволит проверить, действительно ли критерий реагирует на тот дефект, который заявлен в его формулировке.
11.4. Отделить рейтинг от диагностического профиля¶
Итоговый продукт должен показывать не только одно число, но и профиль:
- философская точность;
- глубина анализа;
- источниковая обоснованность;
- естественность языка;
- доля дисквалифицированных ответов;
- типы выявленных ошибок;
- зависимость от длины;
- устойчивость результатов;
- согласованность с экспертами.
Один агрегированный балл без профиля ошибок будет скрывать слишком много значимой информации.
11.5. Провести отложенную валидацию¶
После выбора судьи и критериев необходимо:
- зафиксировать протокол заранее;
- собрать новую выборку вопросов;
- получить новые ответы моделей;
- не менять критерии после просмотра результатов;
- провести независимую экспертную оценку;
- проверить воспроизводимость рейтинга. (9/10) Только после этого можно говорить о валидированном бенчмарке.
12. Итоговый вывод для презентации¶
Текущий этап подтвердил техническую реализуемость русскоязычного философского LLM-бенчмарка и одновременно показал, почему его нельзя строить как простой автоматический прогон через одну модель-судью.
POLLUX оказался быстрым, но недостаточно согласованным с экспертами и выраженно чувствительным к длине ответа. GLM-5.2 показала более перспективное поведение, однако также сжимает оценки, завышает результаты и не распознаёт некоторые критические языковые дефекты.
Наиболее убедительный результат получен при объединении трёх компонентов:
- экспертных эталонов и человеческой калибровки;
- компактного набора содержательно информативных критериев;
- отдельного детерминированного контроля языковых дефектов.
После применения такой архитектуры автоматический рейтинг приблизился к экспертному:
- GPT-5.6 SOL занял первое место;
- DeepSeek и GLM-5.2 образовали сильную среднюю группу;
- AliceAI заняла промежуточную позицию;
- Spark и Qwen опустились после учёта дефектных ответов.
Но этот результат следует трактовать как доказательство перспективности архитектуры, а не как завершённый публичный лидерборд.
Главный итог исследования: философскую компетентность нельзя надёжно измерить одной универсальной оценкой LLM-судьи. Для валидного бенчмарка необходима многослойная система, в которой эксперты задают содержание, автоматический судья масштабирует оценивание, а детерминированные проверки контролируют ошибки, которые LLM систематически пропускает.
Техническое примечание об актуальности артефактов
После обновления main в репозитории присутствуют завершённые пакеты графиков 1.1–4.1, включая:
- финальные пары по 280 экспертным оценкам для графиков 1.1–1.3;
- полные расчёты вариативности на 291 ответе;
- графики 3.1–3.4;
- итоговый график 4.1.
При этом сводная статусная таблица в корневом README.md частично отстаёт от новых файлов: в ней ещё указано, что некоторые графики промежуточны или отсутствуют. В настоящем отчёте использованы более свежие метрики непосредственно из каталогов актуальных графиков, сгенерированные 01.08.2026. (10/10)