Исследую прикладной ИИ: перенос знаний в малые модели, эффективность длинного контекста, нейрокодеки и квантование. Работы публикую открыто: статья, веса и код.
Меня интересуют системы, которые работают на обычном железе: малые модели с возможностями больших, дешёвый инференс и контроль над данными. Ниже — основные работы.
Исследование · arXivarXiv:2502.08213MITОбучение дешевле 10$
01LLM Modules: Knowledge Transfer from a Large to a Small Model using Enhanced Cross-Attention
Перенос знаний из большой модели в малую
Способ передать малой модели знания большой — без дистилляции и полного переобучения. Большая модель замораживается как источник знаний, малая обучается как «рассуждатель», а cross-attention переносит знания между ними.
Метод
Замороженный учитель Qwen2-1.5B и обучаемый студент GPT-Neo-125M на датасете рассуждений Bespoke-Stratos-17k. У учителя снимаются эмбеддинги и LM-head, его выход идёт через слой cross-attention; студент получает свой LM-head под токенизатор учителя.
Результат
15 эпох, около 5 часов на одной NVIDIA L4, стоимость обучения меньше 10 долларов; loss упал с 13,8 до ~1,1. Малая модель воспроизводит структурированные рассуждения учителя.
Исследование · Paper + DOIDOI 10.57967/hf/8973Apache-2.0~5,04 млн параметров
02MPT-VC: Matryoshka Phase-on-Torus Video Codec
Нейрокодек видео на детерминированных операторах
Нейрокодек и токенизатор видео, собранный целиком из детерминированных операторов. Видео сжимается в один rate-ordered поток: начало файла даёт превью, больше байтов — выше качество, весь файл — полное. Одна запись покрывает всю лестницу качества без перекодирования.
Метод
Матрёшечная лапласиан-пирамида на три уровня, оконное axial 3D RoPE-внимание с линейной стоимостью, phase-jump на склейках сцен, FSQ без кодбука и бит-точный арифметический энтропийный кодер.
Результат
На UVG обходит Cosmos Tokenizer от Nvidia по среднему Y-PSNR при меньшем времени и памяти. Чекпойнт — 20,36 МБ, обучение на ~290 часах видео.
Открытая модельApache-2.0GGUF · 537 МБ~44 ток/с на CPU
03Qwen3.5-0.8B GEC — KK · RU · EN
Корректор опечаток, орфографии и пунктуации
Открытая модель, которая чистит сырой текст: восстанавливает пунктуацию, заглавные буквы и абзацы, исправляет опечатки и орфографию. Казахский, русский, английский. Сохраняет слова и смысл: корректирует, а не переписывает.
Метод
Файнтюн Qwen3.5-0.8B плюс собственное квантование: 4/8/16-битный quantization-aware training с бит-точным паритетом train==deploy. Работает в llama.cpp, LM Studio и Ollama на обычном CPU.
Способ уместить длинный контекст в скромную память: соседние токены группируются в сущности до основного стека слоёв, и внимание работает по группам, а не по токенам. Память внимания масштабируется как G² вместо N².
Метод
Кастомный нулевой слой кластеризует соседние токены на prefill и усредняет их в группы; лёгкий адаптер обрабатывает групповые эмбеддинги. Обучаются только этот слой и адаптер, остальное заморожено. База — Qwen3-0.6B.
Открытый статус: опубликованных цифр пока нет. Направление доводится до показываемого состояния.