Искусственный интеллект

Как работает нейросеть

Нейросеть устроена проще, чем подсказывает название. Внутри нет ни мыслей, ни образов — есть таблицы чисел, которые умножаются на входные значения, и процедура, подкручивающая эти числа, пока ответы не станут точнее.

Обновлено
В этой статье

Один нейрон: умножили, сложили, согнули#

Искусственный нейрон получает несколько чисел, каждое умножает на свой
коэффициент — вес, складывает результаты, прибавляет смещение и пропускает
сумму через простую функцию.

выход = f(w1·x1 + w2·x2 + w3·x3 + b)

Функция f нужна, чтобы сеть не свелась к одной большой линейной формуле.
Чаще всего берут ReLU: отрицательное превращается в ноль, положительное
проходит как есть. Пример на числах: веса 0.5, −1.2, 0.3, вход
2, 1, 4, смещение 0.1. Сумма равна 0.5·2 − 1.2·1 + 0.3·4 + 0.1 = 1.0 − 1.2 + 1.2 + 0.1 = 1.1. ReLU оставляет 1.1.

Никакой биологии за этим нет — сходство с живым нейроном осталось только в
названии.

Слои: каждый следующий видит признаки прошлого#

Нейроны собирают в слои, выход одного слоя становится входом другого.
Первый слой работает с сырыми числами — яркостью пикселей, значениями
датчиков. Второй складывает из них простые сочетания: границы, перепады.
Третий — сочетания сочетаний: углы, текстуры, дальше формы. В сети для
картинок такую лестницу хорошо видно, если нарисовать, на что реагирует
каждый слой.

Важно, что «границу» или «угол» никто не программировал. Эти признаки
появились сами, потому что оказались полезны для итогового ответа. Глубокое
обучение — это и есть многослойность: чем больше слоёв, тем более составные
признаки сеть способна собрать.

Обучение: ошибка, производная, маленький шаг#

Сначала веса случайны, и сеть выдаёт чепуху. Дальше повторяется цикл.

  1. Прогнать примеры через сеть и получить предсказания.
  2. Посчитать функцию потерь — число, показывающее, насколько ответы далеки
    от правильных.
  3. Выяснить, в какую сторону сдвинуть каждый вес, чтобы потери уменьшились.
    Это делает обратное распространение ошибки: производные считаются от
    конца сети к началу.
  4. Сдвинуть все веса на маленький шаг в эту сторону. Размер шага называют
    скоростью обучения.

Шагов таких миллионы. Наглядная картинка — спуск по склону в тумане: ты не
видишь дна долины, но чувствуешь уклон под ногами и делаешь шаг вниз.
Слишком мелкий шаг — спуск затянется, слишком крупный — тебя перебросит
через ложбину.

Когда обучение закончено, веса замораживают. Дальше сеть только считает:
вход умножается на готовые числа, и получается ответ. Именно поэтому
работающая модель не меняется от твоих вопросов — различие обучения и
вывода разобрано в статье что такое искусственный
интеллект.

Данные решают больше, чем схема#

Сеть подстраивается ровно под то, что ей показали. Если в примерах кошек
снимали дома, а собак — на улице, сеть может научиться различать не
животных, а фон, и на первой же домашней собаке ошибётся. Такие подпорки
находят себя сами и незаметны, пока не столкнёшься с нужным примером.

Переобучение — вторая типичная беда: сеть запомнила обучающие примеры со
всеми их случайностями и на новых работает хуже. Лечится просто по идее и
муторно на практике: часть данных откладывают и никогда не показывают при
обучении, чтобы честно измерить качество на незнакомом.

Разные задачи — разные схемы#

Свёрточные сети хороши для изображений: один и тот же небольшой фильтр
скользит по картинке, поэтому признак распознаётся в любом углу кадра.
Рекуррентные сети работали с последовательностями, обрабатывая элементы по
очереди. Трансформеры, на которых построены языковые модели, вместо
очереди используют внимание: при обработке каждого элемента сеть взвешивает
все остальные и сама решает, что сейчас важнее. Это позволило считать
параллельно и брать в расчёт длинные тексты; детали — в статье что такое
LLM.

Пределы и риски#

Причину ответа вытащить неоткуда. Внутри — миллионы чисел, а не правила.
Существуют способы подсветить, какие входы повлияли сильнее, но полного
объяснения «почему так» сеть не выдаёт, и от этого страдают области, где
решение надо обосновывать: медицина, кредиты, найм.

Смещения обучающей выборки переезжают в модель целиком. Нет данных о
группе людей, диалекте, редком дефекте — не будет и качества. Сеть не
предупредит, она просто уверенно ошибётся.

Генеративные сети выдумывают. У текстовых это неверные факты и ссылки, у
картиночных — лишние пальцы, нечитаемые надписи и несуществующие подписи
художников. Ошибка выглядит так же аккуратно, как верный результат.

Сеть не сообщает, что столкнулась с незнакомым. Подай ей то, чего в
обучении не было, — она всё равно выдаст ответ с высокой уверенностью,
потому что вопрос «а видела ли я подобное» в вычислении не заложен.

И общее: любой ответ такой системы в медицине, праве и финансах — это
материал для разговора со специалистом, а не замена ему.

И отдельно: ответ модели не заменяет врача, юриста и финансового
консультанта. Там, где цена ошибки — здоровье, деньги или права,
решение принимает человек с ответственностью за него.

План по этапам

  1. Посчитать нейрон рукамиВзять три веса, три входа и смещение, получить выход с ReLU — механика перестаёт быть словами.
  2. Покрутить сеть в песочницеВ браузерной песочнице добавить слои и нейроны, посмотреть, как меняется граница решений.
  3. Разобрать функцию потерьПонять на одном примере, почему обучение сводится к уменьшению одного числа.
  4. Увидеть переобучениеСравнить качество на обучающей и отложенной выборке — разрыв и есть переобучение.
  5. Собрать первую сетьПовторить готовый учебный пример на одном из фреймворков и изменить в нём один параметр.

Начать изучать эту тему у себя

План ляжет в твой репозиторий: отмечай этапы, веди конспект — история изменений покажет, как ты продвинулся.

Начать план

Проверь себя

1.Что подстраивается в ходе обучения нейросети?

2.Сеть отлично работает на обучающих примерах и плохо на новых. Как это называется?

3.Зачем между слоями ставят нелинейную функцию активации?

Источники

Было полезно?

Ещё темы

Искусственный интеллект Что такое искусственный интеллект Искусственный интеллект — не одна технология, а название целой области. В обиходе этим словом называют программы, которые решают задачи, раньше требовавшие человека: распознают речь, переводят, пишут текст, подбирают ответ. Искусственный интеллект Что такое LLM LLM (large language model, большая языковая модель) — программа, обученная продолжать текст. Всё, что она делает, сводится к одной операции: по уже написанному предсказать следующий кусочек и повторить. Искусственный интеллект Нейросети для учёбы Модель способна объяснить непонятное место в три захода и терпеливо ответить на глупый вопрос без осуждения. Она же способна выдать готовую работу, после которой ты не будешь уметь ничего нового. Искусственный интеллект Как пользоваться нейросетями Начать проще, чем кажется: нужен один сервис, одна настоящая рабочая задача и привычка проверять результат. Всё остальное — тонкости, которые разбираются по ходу. Искусственный интеллект Как написать промпт Хороший запрос отличается от плохого не длиной и не вежливостью, а тем, что в нём есть всё нужное для работы: задача, материал, форма ответа и признак годного результата. Искусственный интеллект AI агенты Агент — не особая умная модель, а обвязка вокруг обычной: ей дают список инструментов и позволяют вызывать их в цикле, пока задача не будет доведена до конца или не кончится терпение.

Ещё сценарии