Перейти к содержимому

Исследования ИИ и LLM

Исследую прикладной ИИ: перенос знаний в малые модели, эффективность длинного контекста, нейрокодеки и квантование. Работы публикую открыто: статья, веса и код.

Меня интересуют системы, которые работают на обычном железе: малые модели с возможностями больших, дешёвый инференс и контроль над данными. Ниже — основные работы.

Исследование · arXivarXiv:2502.08213MITОбучение дешевле 10$

LLM Modules: Knowledge Transfer from a Large to a Small Model using Enhanced Cross-Attention

Перенос знаний из большой модели в малую

Способ передать малой модели знания большой — без дистилляции и полного переобучения. Большая модель замораживается как источник знаний, малая обучается как «рассуждатель», а cross-attention переносит знания между ними.

Метод

Замороженный учитель Qwen2-1.5B и обучаемый студент GPT-Neo-125M на датасете рассуждений Bespoke-Stratos-17k. У учителя снимаются эмбеддинги и LM-head, его выход идёт через слой cross-attention; студент получает свой LM-head под токенизатор учителя.

Результат

15 эпох, около 5 часов на одной NVIDIA L4, стоимость обучения меньше 10 долларов; loss упал с 13,8 до ~1,1. Малая модель воспроизводит структурированные рассуждения учителя.

Исследование · Paper + DOIDOI 10.57967/hf/8973Apache-2.0~5,04 млн параметров

MPT-VC: Matryoshka Phase-on-Torus Video Codec

Нейрокодек видео на детерминированных операторах

Нейрокодек и токенизатор видео, собранный целиком из детерминированных операторов. Видео сжимается в один rate-ordered поток: начало файла даёт превью, больше байтов — выше качество, весь файл — полное. Одна запись покрывает всю лестницу качества без перекодирования.

Метод

Матрёшечная лапласиан-пирамида на три уровня, оконное axial 3D RoPE-внимание с линейной стоимостью, phase-jump на склейках сцен, FSQ без кодбука и бит-точный арифметический энтропийный кодер.

Результат

На UVG обходит Cosmos Tokenizer от Nvidia по среднему Y-PSNR при меньшем времени и памяти. Чекпойнт — 20,36 МБ, обучение на ~290 часах видео.

Открытая модельApache-2.0GGUF · 537 МБ~44 ток/с на CPU

Qwen3.5-0.8B GEC — KK · RU · EN

Корректор опечаток, орфографии и пунктуации

Открытая модель, которая чистит сырой текст: восстанавливает пунктуацию, заглавные буквы и абзацы, исправляет опечатки и орфографию. Казахский, русский, английский. Сохраняет слова и смысл: корректирует, а не переписывает.

Метод

Файнтюн Qwen3.5-0.8B плюс собственное квантование: 4/8/16-битный quantization-aware training с бит-точным паритетом train==deploy. Работает в llama.cpp, LM Studio и Ollama на обычном CPU.

Исследование · в работеMITВ работе

Context Merging

От токенов к сущностям и концептам

Способ уместить длинный контекст в скромную память: соседние токены группируются в сущности до основного стека слоёв, и внимание работает по группам, а не по токенам. Память внимания масштабируется как G² вместо N².

Метод

Кастомный нулевой слой кластеризует соседние токены на prefill и усредняет их в группы; лёгкий адаптер обрабатывает групповые эмбеддинги. Обучаются только этот слой и адаптер, остальное заморожено. База — Qwen3-0.6B.

Открытый статус: опубликованных цифр пока нет. Направление доводится до показываемого состояния.

05Профили

Где живут работы

Статьи и веса выложены открыто.

Исследовательское сотрудничество

Открыт к совместным работам, рецензированию и выступлениям: малые модели, перенос знаний, on-device ИИ.