Что такое backpropagation простыми словами
Представьте, что вы бросаете дартс. Первый раз — мимо. Вы смотрите, насколько отклонилась стрела, и чуть меняете бросок. Нейросеть делает то же самое, но внутри у неё сотни слоёв и миллиарды «регулировок».
Backpropagation (обратное распространение ошибки) — это алгоритм, который:
И так тысячи, миллионы раз. Благодаря этому нейросети сами находят важные признаки — сначала линии и углы, потом уши и хвосты, потом целого кота.
Почему этот алгоритм — пусковая кнопка ИИ-революции
До появления backpropagation нейросети были игрушкой: больше двух слоёв обучить не получалось. Алгоритм снял три главных барьера:
Ручная математика ушла в прошлое — не нужно выводить формулы для каждой новой архитектуры. Время обучения упало с тысяч лет до дней — один обратный проход даёт все нужные градиенты (математические поправки) сразу. Модели стали масштабироваться — чем больше данных и параметров, тем точнее результат. Именно это позволило создать GPT-3, GPT-4, AlphaFold.
Кратко: backprop — это «быстрая сортировка» в мире нейросетей. Без него глубокое обучение оставалось бы красивой теорией.
Кто и когда на самом деле придумал backpropagation
Долгое время на Западе считалось, что алгоритм открыли в 1986 году Румельхарт, Хинтон и Уильямс . Они ввели термин «backpropagation» и провели эффектные эксперименты.
Но история сложнее.
Александр Галушкин (СССР) — первый
В 1974 году в Москве вышла книга «Синтез многослойных систем распознавания образов» . Её автор — Александр Иванович Галушкин — привёл:
Важная деталь: книга сдана в печать 28 февраля 1974 года . А за год до этого вышли статьи Галушкина с коллегами, где описывалось градиентное обучение скрытых слоёв.
Пол Вербос (США) — независимо, но позже
Диссертация Пола Вербоса «Beyond Regression» защищена в Гарварде в августе 1974 года — на полгода позже книги Галушкина. Вербос тоже описал обратное распространение, назвав его «ordered derivatives», и даже привёл пример для двухслойной сети. Но термин «backpropagation» он не использовал.
Румельхарт, Хинтон, Уильямс (1986) — популяризаторы, а не первооткрыватели
Именно они дали алгоритму имя, показали впечатляющие результаты на многослойных сетях и запустили «нейросетевой бум». Но математическая основа была уже создана за 12 лет до них.
А что насчёт «параллельного открытия»?
Многие западные источники пишут: «Вербос и Галушкин независимо друг от друга открыли backprop в 1974 году». Это не совсем точно.
Почему же работа Галушкина осталась неизвестной на Западе? Языковой барьер (книга только на русском, тираж 8000 экземпляров). Холодная война — обмен научной информацией был минимальным. Отсутствие громких экспериментов — нейросети глубиной 10+ слоёв и GPU тогда ещё не существовали.
«Прадедушка» AutoML — Алексей Ивахненко
Ещё до Галушкина советский учёный Алексей Григорьевич Ивахненко разработал метод группового учёта аргументов (GMDH) в конце 1960-х.
Идея была гениальной: сеть сама решает, какие узлы оставить, какие удалить, и автоматически растёт в глубину. Это прообраз современного AutoML, где архитектура модели подбирается без участия человека.
Именно работы Ивахненко стали трамплином для Галушкина: если структуру можно строить автоматически, нужен быстрый метод настройки весов — и Галушкин предложил backprop.
Так кто же заслуживает славы?
Никакой «фальсификации» нет — так сложилось исторически. Но восстановить справедливость стоит: в учебниках по ИИ нужно указывать Галушкина и Вербоса как первооткрывателей, а не только Хинтона.
Вывод: алгоритм изменивший мир — наш общий
Backpropagation — это технология, которая впервые дала машинам способность учиться на собственных ошибках . Он сделал возможным ChatGPT, распознавание лиц, голосовых помощников и генерацию изображений.
И хотя алгоритм родился в СССР, а расцвёл на Западе, его история — прекрасный пример того, как великие идеи не знают границ. Просто иногда им нужно немного времени и правильного языка, чтобы облететь весь мир.
Что можно сделать уже сегодня?
• Галушкин, А. И. (1974). Синтез многослойных систем распознавания образов.
https://cat.gpntb.ru/?id=FT/ShowFT&sid=2fd4458e5ab8a6bfb401f07b8efc01cd&page=1&squery=
• Л. Н. Ясницкий («О приоритете советской науки…», журн. «Нейрокомпьютеры: разработка, применение», т. 21 № 1, с. 6-8)
https://publications.hse.ru/pubs/share/direct/317633580.pdf
• Ивахненко А.Г. (1969). «Самообучающиеся системы распознавания и автоматического управления»
• Вербос, П. (1974). Beyond Regression.
https://gwern.net/doc/ai/nn/1974-werbos.pdf
Комментарии
Спасибо за статью. Не знал, очень интересно. Опять какая-то история как с радио, лампочкой и наверно еще много чем…
Не уверена, что отсутствие громких экспериментов - это причина, а не следствие. Ведь если бы не было языкового барьера, работу бы заметили и без демонстрации на GPU, правда? 😊
Так её и заметили. В то время работали программы научной разведки например, Project Socrates в DARPA, через которую книга Галушкина и уехала через спец почту в Лэнгли. Backpropagation, возможно, стал крупнейшим невидимым экспортом советской науки в западную цивилизацию.
Интересная версия про Project Socrates, честно, не слышала о таком. Но если работа и правда уехала через спецпочту, почему тогда Галушкина до сих пор не упоминают в западных учебниках? 😊
а зачем?
Вы пишете про языковой барьер и тираж 8000 - а каким термином сам Галушкин называл свой алгоритм?
Кстати, про 'правильный язык': даже если бы Галушкин сразу опубликовался на английском, без практических демонстраций на мощных компьютерах его алгоритм остался бы малоизвестным - как и метод Ивахненко с его GMDH
Сам по себе приоритет Галушкина интересен с исторической точки зрения, но его отсутствие в мейнстриме объясняется не только языковым барьером, а фундаментальным отсутствием вычислительных ресурсов для демонстрации практической пользы. Без экспериментов 1986 года алгоритм оставался бы математическим курьёзом, независимо от того, кто его первым вывел
Книга Галушкина А. И. - "Синтез многослойных систем распознавания образов" написана для разработчиков систем «свой – чужой» и технического зрения: цель — минимизация риска ошибочной классификации под ограничениями времени реакции. Метод сразу был вписан в реальную инженерную задачу и применялся в военных системах распознавания и точно не был - математическим курьёзом.
Да ладно. Интенции ученика Александрова- Моисеева по оптимизации логистики,изложенные в популярных изданиях позднейшей СовДепии явились Мат.обоснованием глобальной логистической матрицы. Хотя также не моделировались в мировом масштабе. Этот патентный казус «применение известного решения для новых задач» патологически нарушает принцип патентной чистоты и право преждепользования. Мойшенники от науки делают ровно то же.