Открытые артефакты
Что лаборатория строит
Измерительную лабораторию, которая только измеряет, трудно проверить. Здесь — артефакты, которые лаборатория публикует открыто: модели, обучающий датасет, харнесс и архив доказательств; каждый под разрешительной лицензией, каждый решает проблему, на которую лаборатория наткнулась в своей же работе. Показателей производительности здесь нет: измеренные цифры живут в реестре клеймов.
- Модель Лицензия: Apache-2.0 База: deepvk/RuModernBERT-small
strizh-ru-retriever
Какую проблему решает
Самостоятельно развёрнутому русскому RAG нужен ретривер первой стадии, достаточно маленький, чтобы жить на CPU рядом со всем остальным, — и не требующий префиксов query/document, которые забывает добавить каждая обвязка.
Что это
Энкодер предложений на 24.4M параметров и 4 слоя, полученный послойным прунингом и переобучением RuModernBERT-small. Один 384-мерный эмбеддинг на текст, без префиксов, архитектура принимает до 8192 токенов (контрастивное обучение шло на последовательностях 256 токенов).
- Модель Лицензия: Apache-2.0 База: t-tech/T-lite-it-2.1 (Qwen3-8B)
agmind-rag-splitter-ru
Какую проблему решает
Нарезка фиксированного размера рвёт русские документы посреди мысли и разваливает таблицы и блоки кода. Поиск после этого возвращает фрагменты, которые сами по себе уже ни на что не отвечают.
Что это
LoRA-дообучение, принимающее документ, заранее разбитый на нумерованные юниты, и возвращающее индексы границ плюс тему в JSON — чанки собираются на стороне хоста. В v2 датасет вырос до 28k примеров по шести типам источников и появился отложенный эталон: 140 out-of-domain юридических документов, размеченных консенсусом двух независимых моделей с арбитражем.
- Датасет Лицензия: Apache-2.0
agmind-rag-splitter-ru-data
Какую проблему решает
Обучающие данные русских моделей чанкинга никто не публикует, поэтому никто не может проверить, что именно модель сочла границей.
Что это
Обучающий корпус сплиттера, опубликованный так, чтобы разметку можно было проверить, а модель — переобучить кому угодно.
- Модель Лицензия: Apache-2.0 База: Qwen/Qwen3-1.7B
qmd-query-expansion-ru
Какую проблему решает
Стоковая модель расширения запросов в локальном поисковом движке qmd обучена только на английском: русский запрос она переписывает в англоязычный шаблон-галлюцинацию, а формат вывода разваливается (upstream-issues #774 и #454). BM25 в qmd вдобавок использует стеммер Портера, не понимающий русскую морфологию, поэтому расширение обязано само покрывать словоформы.
Что это
Drop-in замена для русского, обученная по upstream-рецепту finetune, выдающая и семантические, и морфологические расширения, чтобы лексический поиск находил словоформы.
- Харнесс Лицензия: Apache-2.0
agmind-bench
Какую проблему решает
Опубликованная цифра ничего не стоит, если инструмент, который её произвёл, закрыт: никто не может проверить, что считалось отказом, и воспроизвести ячейку.
Что это
Сам измерительный харнесс: раннер, замороженные корпуса ворклоадов, шесть гейтов качества с юнит-тестами и DuckDB-запросы, которыми выводится каждое опубликованное значение.
- Архив доказательств Лицензия: CC BY 4.0
agmind-lab
Какую проблему решает
Сводные таблицы могут спрятать что угодно. Без поштучных записей сторонний человек не отличит чистый результат от отобранного.
Что это
Каждый опубликованный прогон как запечатанный бандл доказательств: манифест, поштучные записи включая отказы, поштучные вердикты гейтов, агрегаты харнесса, лог сервера и чексуммы — плюс каталог, связывающий бандлы с клеймами.
Числа, описывающие артефакт (количество параметров, размерность эмбеддинга, объём датасета), — это свойства самого артефакта, проверяемые на его странице. Всё про то, насколько быстро или хорошо работает система, — измеряется и живёт вместе с доказательствами в реестре клеймов.