Весь ИИ за одно видео
- Дата
- 30.08.2026
- Длительность
- 14:29
- Канал
- Константин Коломейцев | AI Zone
Смотреть на YouTubeКак работает искусственный интеллект на самом деле — от искусственного нейрона и трансформера до ИИ-агентов, MCP и skills. Простыми словами разбираю, почему нейросеть предсказывает следующий токен, зачем ей контекст и как правильно ставить задачи ИИ.
Транскрипт видео
Привет. Если ты, да, ты ни разу не писал свою ей модель, то ты 100% не знаешь, как работает искусственный интеллект. Ну, ничего страшного, сейчас я всё расскажу. Видео будет состоять из двух частей. Первое - это как работает искусственный интеллект. Вторая - это как пользоваться этим искусственным интеллектом, на что обращать внимание, а что просто хайп на тему. Но начнём мы издалека. То, на чём на самом деле основывается работа искусственного интеллекта, а именно с мозга. Ведь не зря это всё называют искусственные нейронные сети. Вообще мозг - это супер сложная штука, поэтому я сильно упрощу, ведь нам важен сам принцип. Вот есть мозг.
В нём огромное количество нейронов, которые связаны между собой синапсами. Наше тело в мозг постоянно отправляет какие-то сигналы. Допустим, мы что-то увидели, услышали, потрогали. В мозгу активируются определённые нейроны, затем вторые, третьи и так по цепочке дальше. И вот эти синапсы, которые связывают наши нейроны, со временем меняются. Какие-то становятся сильнее, какие-то слабее. Собственно, так мы и обучаемся. Допустим, мы увидели букву Б, написали букву Б, услышали, что это буква Б, и мы выучили, что такое буква Б. Или, например, мы дотронулись до чего-то горячего, сильно обожглись и закричали слово на только что выученную букву Б.
А наш мозг научился тому, что не надо трогать горячее и сувать, куда попало свои шаловливые ручонки. Надеюсь, общий принцип понятен. И вот учёные, пораскинув мозгами, поняли, что они сами могут собрать такую статистическую модель, а затем попробовать её каким-то образом обучить. И вот в 1943 году выходит научная работа про логическую модель искусственного нейрона. А уже к 1960 году собрали первый электронный перцептрон, который умел отличать по картинкам отдельные буквы и формы. И самое главное, он работал не на каком-то жёстком алгоритме, а именно обучался с помощью картинок.
Взяли очень много-много изображений, пропустили через его веса, нейроны подстроились и научились различать разные изображения. Это круг, это квадрат, это буква Е, а это буква Ф. Ну так вот, к чему всё это долгое погружение в историю? А всё дело в том, что за последние 65 лет принцип работы нейросетей сильно не изменился. Да, добавились некоторые новые механизмы типа слоя внимания. Да, вычислительные мощности теперь позволяют делать расчёты в миллиардах таких нейронов, но по сути своей это всё та же модель 1943 года, которая основана на физиологии человеческого мозга. Из всего этого вам важно запомнить две вещи.
Искусственный интеллект - это не какая-то суперсложная программа. Нет, это просто статистическая модель, которая пытается симулировать поведение человеческого мозга. Второе. Искусственный интеллект - это не база знаний. По сути, это просто гигантская таблица цифр, которая хранит силу того или иного нейрона. Если упрощённо, то на вход нейросеть мы подаём некий сигнал. В случае больших языковых моделей этот текст представлен в виде цифр. Так называемые мbдинги. Этот сигнал проходит по таблице нейронов. Выходной сигнал как-то обрабатывается и превращается обратно в текст. Также из этого можно сделать некоторые выводы.
Например, то, что Ии сам по себе пассивен и он не может задумать какое-то злодеяние. Если на вход в него не поступит никакого сигнала, то и делать он ничего не будет. А все эти рассказы про то, что Ии захватит мир - это просто сказки для людей, которые не разбираются, как работает искусственный интеллект. Всегда, абсолютно всегда, должен быть кто-то, кто подаст злодейский сигнал на вход и яишки. Ещё один интересный вывод - это то, что модель не может знать того, чего она не видела, так как это просто статистическая модель.
Да, она может в ходе некоторых размышлений прийти к каким-то выводам, но в основном она знает только то, на чём её обучали. А вспомнит она конкретные вещи или нет, очень сильно зависит от постановки вопроса, то есть от входящего сигнала. Но это мы забегаем немного вперёд. Двигаемся дальше ко второму важному шагу в понимании искусственного интеллекта и нейросетей. 2017 год. Выходит работа от исследователей из Google Attention All. Начнём с проблемы, которую они пытались решить, а именно машиной перевод. Как сделать так, чтобы и мог перевести текст с одного языка на другой и сделал это правильно.
Главным препятствием на тот момент была существовавшая архитектура. Называлась она регурентные нейронные сети. Не буду углубляться в технические подробности, но вы должны понимать, что в этой нейросети всё очень сильно зависит от последовательности, и весь перевод обрабатывается слово за словом. Из этого вытекают две проблемы. Во-первых, это очень медленно. А во-вторых, чтобы уловить смысл между словами на большой последовательности, нужно протащить смысл через всё предложение, чего, на самом деле, очень сложно добиться.
Им нужен был механизм, который мог рассчитывать отношения слов, на каком бы расстоянии они не были, и при этом делать это максимально параллельно. Тут на свет и появляются трансформеры. Новая архитектура, которая позволяет определить отношения между словами на любом расстоянии и делать это практически параллельно. Благодаря этой новой архитектуре появились современные нейросети, которые основаны на трёх столпах: искусственный нейрон, механизм внимания и параллельные вычисления. На этом урок истории закончим и начнём погружаться в особенности работы этих самых трансформерных нейросетей.
А первое, что я хотел бы рассказать - это самый главный термин для вашего кошелька, а именно токены. Что это такое? Как я уже сказал, неросеть обрабатывает всего лишь числовые сигналы. Но как перевести речь в числа? На самом деле всё довольно просто. Мы берём текст, разбиваем его на некоторые кусочки, каждому кусочку присваиваму определённый индекс. Вот тебе и числовое представление текста. Но воспользоваться просто алфавитом нельзя, иначе мы получим слишком узкий словарь, который не будет иметь достаточной статистической выразительности. Пока не заморачивайтесь, просто это неэффективно.
Но при этом мы и не можем каждое слово занести в словарь, иначе придётся дообучать нейросеть под каждое новое слово, которое появляются постоянно. И тут нам на помощь снова приходит статистика. Мы просто берём огромные массивы текста, смотрим, какие кусочки появляются чаще всего, и заносим их в словарь. Самое главное, чтобы с помощью этого словаря можно было разбить абсолютно любой текст, а самих этих кусочков было как можно меньше. И вот эти кусочки и есть наши самые токены. А словарь, который переводит текст в эти токены, называется токенайзеер.
Ну и, как вы понимаете, мы платим за каждый токен, потому что весь наш текст разбивают на эти токены, и эти токены должны пройти через всю нейросеть, а это миллиарды вычислений. Вычисление - это нагрузка, а нагрузка - это потребление электричества, износ оборудования. За это мы и платим. Финальная схема того, как работает нейросеть, выглядит так. На входе у нас есть большая текстовая последовательность. Наш запрос, промт либо что-то ещё. Весь текст мы делим на кусочки с помощью токенайзеров. Каждый токен проходит сквозь всю нейросеть, через эту огромную таблицу с миллиардами цифр. Весь входящий текст делает это практически параллельно.
Почему практически? Не забываем про механизм внимания, который должен рассчитывать отношения между токенами последовательности. И вот весь наш текст прошёл через эту нейросеть. Последний токен в последовательности, проходя через ту же нейросеть и собирая внимание со всей остальной последовательности, попадает в определённый модуль, который называется LMhead, либо голова нейросети. И всё, что делает эта голова - это предсказывает следующий токен. Она просто возвращает цифру. Эта цифра преобразуется в текст, и затем этот текст снова проходит через всю нейросеть. Вот и всё. Это основной принцип работы современных нейросетей.
Вы подаёте большой текст, он преобразуется в числовые сигналы. Числовые сигналы проходят через всю нейросеть. Каждый последний токен после расчётов попадает в голову. Голова предсказывает следующий токен и так далее. Последний токен попадает в голову, переводится в текст, опять проходит через всю нейросеть, опять попадает в голову. Ну и так до конца ответа. Большего конкретно сам и не делает ничего. Теперь вы понимаете, кто печатает текст по ту сторону ей чата и почему это выглядит как последовательный набор слов. Ну и, наконец, перейдём к особенностям работы с искусственным интеллектом. Разберу просто самые важные вещи.
Для начала поговорим, как правильно составлять запросы. Как вы поняли, искусственный интеллект - это одна большая статистическая модель, которая в своих весах хранит некоторые данные. Но чтобы нужные нейроны активировались, нужен соответствующий входящий сигнал. Именно для этого и существуют всякие техники промзинга, типа выступи в роли старшего инженера-программиста. И в нейросети сразу активируются нужные нейроны, связанные с программированием, с опытом и лучшими практиками. И она постарается написать код, как бы это сделал старший инженер-программист.
С другой стороны, если вы спрашиваете её какую-то неоднозначную вещь, нужно обязательно уточнять, с какой стороны на неё смотреть, потому что, скорее всего, при обучении у него были разные точки зрения. Если вы ему не скажете, с какой стороны рассмотреть ту или иную вещь, он просто выберет вариант, который попадался чаще в обучении. Ещё одной очень важной вещью является контекст. Как я уже сказал, и сам ничего не думает, ничего не решает. Всё, что он делает - это просто реагирует на входящий сигнал. И он точно не знает ничего ни о вас, ни о вашей компании, ни о ваших задачах. И особенно он ничего не знает о том, что творится в вашей голове.
Поэтому любая постановка задачи должна сопровождаться полным контекстом, чтобы у него были все данные, необходимые для решения этой самой задачи. Если же вы просто попросите сделать его хорошо, он не знает, что такое хорошо именно для вас. Он просто знает, что такое хорошо из статистики своего обучения. Поэтому, когда и делает какую-то дичь, вы должны ругать не его, вы должны ругать себя, потому что не предоставили ему весь нужный контекст. Ещё хочу затронуть тему длины контекста. Длина контекста модели зависит от двух вещей. Во-первых, это столько данных, сколько в неё физически помещается в оборудование.
Во-вторых, и это очень важно, это та длина последовательности, на которой нейросеть обучалась. Допустим, у нас есть нейросеть, обученная на длине последовательности в 50.000 токенов. Если даже оборудование позволяет вместить 100.000 токенов, то она просто не знает, что делать с токенами, которые идут после пятидесятитысячного знака. Поэтому, скорее всего, она начнёт просто жёстко тупить. А важна длина контекста именно потому, что, как я уже сказал, не Россиеть ничего не знает ни про вас, ни про вашу компанию и ваша задача. Соответственно, чтобы сделать задачу хорошо, ей нужно предоставить огромное количество данных.
И чем сложнее задача, тем больше данных ей нужно предоставить. И обычно для этого нужно очень-очень много токенов. И, на мой взгляд, минимальная жизнеспособная длина контекста для имоделей - это 1 млн токенов. При меньшем объёме ставить реальные задачи и очень сложно, и, скорее всего, вам понадобится какая-то предварительная подготовка. Самому вычитать нужные данные, их как-то скомпоновать и потом, чтобы и просто пришла практически на готовое решение. А кому этим охота заниматься, естественно, никому. Ну и на сладенькое хотел бы обсудить, как работают и агенты.
Самое главное, держите в голове, что и всё, что делает - это берёт входящий сигнал из текста и предсказывает каждый следующий токен по одному. Так вот, агенты - это просто набор инструментов удобной оболочки. который просто тупо следит за выводом и модели, распознаёт некоторые инструкции, а затем следует им. Для примера можно взять обычное чтение файлов. Допустим, мы говорим нашей модели: "Ты умный помощник, который умеет читать файлы". Для чтения файла вызови функцию file read и затем даём путь до файла. После этого запускается генерация токенов. Агент следит за выводом.
Как только он видит, что нейросеть напечатала файл read и указала путь до файла, она останавливает генерацию, читает файл и возвращает прочтённое в саму нейросеть в виде текста. Затем Неросеть получает весь этот текст и просто продолжает генерировать токен за токеном до момента, пока не сгенерируется токен завершения ответа. И потом в интерфейсе ответ показывается пользователю. Вот и всё. Да, конечно, в современных агентах это всё завёрнуто в различные блоки. Тут вызов инструмента, тут размышление модели, тут её ответ.
Всё это выглядит красиво и высокотехнологично, но под капотом это просто огромная стена текста, разбитая по блокам некоторыми специальными текстовыми токенами. Вот вам и вся магия агентов. То есть из всего этого вы должны понимать, что любой иагент может работать с любой нейросетью. Просто из-за того, что поставщиков так много, у каждого поставщика можно сказать свой разъём. Допустим, Charge GPT предоставляет разъём Type-C, какой-нибудь клод, разъём Lightning, а китайские модели Micro USB. И вот некоторые агенты поддерживают Type-C, некоторые Lightning, некоторые micro USB, некоторые позволяют работать с несколькими.
Из всего этого вы должны понять простую вещь. Когда вы слышите, что какой-то поставщик и выкатил какую-то крутую штуку, но эта штука не связана ни с размером модели, ни с её обучением, ни с её длиной контекста, а просто это какая-то фигня для их и е агента, знаете, сейчас вы услышите просто какую-то рекламную чушь, просто тупо нацеленную на хайп, и вы можете смело пропускать это мимо ушей. Вот и всё. Нет никакой магии, никаких чёрных ящиков. Мы все прекрасно понимаем, как функционально работает нейросеть.
Да, мы не можем предсказать, что именно ответит мне Росеть на тот или иной вопрос, но почему именно она отвечает, мы прекрасно знаем, потому что в её обучении были такие данные. Был даже очень интересный эксперимент. Исследователи натренировали нейросеть на всех данных, собранных до 1931 года. Ишка совершенно не знала ни о компьютерах, ни о языках программирования, но умела писать готические рассказыть предсказания на сороковые пятидесятые года. Кому интересно, ссылку оставлю в описании.
А напоследок я хочу разобрать пару вещей, о которых слышно буквально с каждого второго ТикТока про искусственный интеллект, но которые при этом вам на самом деле нафиг не нужны. А начнём мы со скилов. Скилы, скилы, скилы. Всё, что вам нужно знать про скилы - это просто набор инструкций, которые в основном применяются для повторяющихся задач. И лучше всего работают именно те скилы, которые вы написали для себя сами. Забудьте про какие-то магические скилы, которые набирают десятки тысяч звёзд на гитхабе. Это всё полная чушь. Большинство скилов скорее даже вредны, просто потому что занимают контекст вашей модели.
и при этом не несут никакой реальной пользы. Единственные скилы, которые реально нужны - это инструкции к конкретному программному обеспечению и как именно им пользоваться. Но обычно они идут сразу в комплекте, и тут не стоит выбора использовать их или не использовать. Это просто документация. Вторая хайповая штука про яишки - это MCP, так называемый modelк протокол. Всё, что вы должны знать про это - это просто тупо интерфейс для работы с каким-то программным обеспечением. Вот вы, например, пользуетесь почтой, пользуетесь ей через веб-интерфейс или мобильный интерфейс, сделанный именно для нас, для людей.
Так вот, MCP - это такие же интерфейсы, только сделанные для агентов. Штука, безусловно, нужная, но я постоянно вижу, как люди забивают своих агентов куче MCP, чтобы они были вооружены. Но вы должны понимать, что каждая MCP - это довольно большая инструкция с различными параметрами. Если она не нужна нейросети в данный момент, то и не нужно пихать её, потому что она просто тупо откидает контекст. А плюс к этому ещё может запутать яишку. Совет очень простой. Когда вы ставите задачу, вы говорите, какие MCP использовать при выполнении этой задачи. Вот и всё.
Ну и последнее - это десятки различных агентов для различных моделей под разные задачи, так называемые и харнесы. Я лично видел, как у человека на компьютере установлено 10 разных агентов. Да, этих самых агентов существуют уже десятки, если не сотни. И каждый из них заявляет, что они отлично решают какую-то задачу. Но вы-то уже понимаете, как работает искусственный интеллект. И всё, что может дать агент яишки - это просто набор каких-то тулов и инструкций. Спрашивается, зачем всё это нужно. А всё просто.
Обычно поставщики таких агентов предоставляют ещё и дополнительную подписку на те же самые -мо модели, просто со своей небольшой наценкой, на которой, собственно, они и зарабатывают. Поэтому выберите парочку агентов, которых вам удобно работать, и используйте их, не заморачиваясь обо всех остальных. Составляйте свои скилы, добавляйте нужные вам инструменты и делайте чёткую постановку задачи. Вот и всё. Кстати говоря, у меня есть собственный агент, совершенно бесплатный, и работает со всеми доступными провайдерами по вашим же подпискам. Просто устанавливаете и работаете. Называется КОТ, ссылка в описании, или по адресу agentkot.ai.
Надеюсь, это видео было полезно и помогло вам лучше понять, как работает ИИ на самом деле. И теперь вы будете иначе смотреть на новости об опасном ИИ или о новом прорывном агенте. Да, искусственный интеллект - это суперкрутой инструмент, но это всего лишь инструмент, которым вы должны уметь пользоваться и хотя бы примерно понимать, как он работает. На этом всё. Пока.