Backprop — русский алгоритм, который Запад назвал своим: история и истинный первооткрыватель

Тема: backpropagation · история создания и приоритет открытия

Кратко

Алгоритм обратного распространения ошибки (backpropagation) был впервые опубликован советским учёным Александром Галушкиным в феврале 1974 года. Пол Вербос независимо описал его в августе 1974 года. Популяризирован Румельхартом, Хинтоном и Уильямсом в 1986 году, которые ввели термин и запустили нейросетевой бум.

Главное

  • Backpropagation — ключевой алгоритм обучения нейросетей, позволяющий распространять ошибку назад по слоям и корректировать веса.
  • Первым полное описание алгоритма дал Александр Галушкин в книге «Синтез многослойных систем распознавания образов» (февраль 1974).
  • Пол Вербос независимо предложил аналогичный алгоритм в диссертации «Beyond Regression» (август 1974).
  • Румельхарт, Хинтон и Уильямс популяризировали метод в 1986 году, дав ему название backpropagation.
  • Работы Галушкина остались незамеченными на Западе из-за языкового барьера и Холодной войны.
  • Алексей Ивахненко разработал метод группового учёта аргументов (GMDH) — прообраз AutoML, что повлияло на Галушкина.
  • В учебниках по ИИ следует указывать Галушкина и Вербоса как первооткрывателей, а не только Хинтона.

Без него не было бы ни ChatGPT, ни Midjourney. Алгоритм, который научил нейросети учиться на ошибках, впервые появился в СССР в 1974 году. Но почему его называют «американским»?

Что такое backpropagation простыми словами

Представьте, что вы бросаете дартс. Первый раз — мимо. Вы смотрите, насколько отклонилась стрела, и чуть меняете бросок. Нейросеть делает то же самое, но внутри у неё сотни слоёв и миллиарды «регулировок».

Backpropagation (обратное распространение ошибки) — это алгоритм, который:

И так тысячи, миллионы раз. Благодаря этому нейросети сами находят важные признаки — сначала линии и углы, потом уши и хвосты, потом целого кота.

Почему этот алгоритм — пусковая кнопка ИИ-революции

До появления backpropagation нейросети были игрушкой: больше двух слоёв обучить не получалось. Алгоритм снял три главных барьера:

Ручная математика ушла в прошлое — не нужно выводить формулы для каждой новой архитектуры. Время обучения упало с тысяч лет до дней — один обратный проход даёт все нужные градиенты (математические поправки) сразу. Модели стали масштабироваться — чем больше данных и параметров, тем точнее результат. Именно это позволило создать GPT-3, GPT-4, AlphaFold.

Кратко: backprop — это «быстрая сортировка» в мире нейросетей. Без него глубокое обучение оставалось бы красивой теорией.

Кто и когда на самом деле придумал backpropagation

Долгое время на Западе считалось, что алгоритм открыли в 1986 году Румельхарт, Хинтон и Уильямс . Они ввели термин «backpropagation» и провели эффектные эксперименты.

Но история сложнее.

Александр Галушкин (СССР) — первый

В 1974 году в Москве вышла книга «Синтез многослойных систем распознавания образов» . Её автор — Александр Иванович Галушкин — привёл:

Важная деталь: книга сдана в печать 28 февраля 1974 года . А за год до этого вышли статьи Галушкина с коллегами, где описывалось градиентное обучение скрытых слоёв.

Пол Вербос (США) — независимо, но позже

Диссертация Пола Вербоса «Beyond Regression» защищена в Гарварде в августе 1974 года — на полгода позже книги Галушкина. Вербос тоже описал обратное распространение, назвав его «ordered derivatives», и даже привёл пример для двухслойной сети. Но термин «backpropagation» он не использовал.

Румельхарт, Хинтон, Уильямс (1986) — популяризаторы, а не первооткрыватели

Именно они дали алгоритму имя, показали впечатляющие результаты на многослойных сетях и запустили «нейросетевой бум». Но математическая основа была уже создана за 12 лет до них.

А что насчёт «параллельного открытия»?

Многие западные источники пишут: «Вербос и Галушкин независимо друг от друга открыли backprop в 1974 году». Это не совсем точно.

Почему же работа Галушкина осталась неизвестной на Западе? Языковой барьер (книга только на русском, тираж 8000 экземпляров). Холодная война — обмен научной информацией был минимальным. Отсутствие громких экспериментов — нейросети глубиной 10+ слоёв и GPU тогда ещё не существовали.

«Прадедушка» AutoML — Алексей Ивахненко

Ещё до Галушкина советский учёный Алексей Григорьевич Ивахненко разработал метод группового учёта аргументов (GMDH) в конце 1960-х.

Идея была гениальной: сеть сама решает, какие узлы оставить, какие удалить, и автоматически растёт в глубину. Это прообраз современного AutoML, где архитектура модели подбирается без участия человека.

Именно работы Ивахненко стали трамплином для Галушкина: если структуру можно строить автоматически, нужен быстрый метод настройки весов — и Галушкин предложил backprop.

Так кто же заслуживает славы?

Никакой «фальсификации» нет — так сложилось исторически. Но восстановить справедливость стоит: в учебниках по ИИ нужно указывать Галушкина и Вербоса как первооткрывателей, а не только Хинтона.

Вывод: алгоритм изменивший мир — наш общий

Backpropagation — это технология, которая впервые дала машинам способность учиться на собственных ошибках . Он сделал возможным ChatGPT, распознавание лиц, голосовых помощников и генерацию изображений.

И хотя алгоритм родился в СССР, а расцвёл на Западе, его история — прекрасный пример того, как великие идеи не знают границ. Просто иногда им нужно немного времени и правильного языка, чтобы облететь весь мир.

Что можно сделать уже сегодня?

•    Галушкин, А. И. (1974). Синтез многослойных систем распознавания образов.

https://cat.gpntb.ru/?id=FT/ShowFT&sid=2fd4458e5ab8a6bfb401f07b8efc01cd&page=1&squery=

•    Л. Н. Ясницкий («О приоритете советской науки…», журн. «Нейрокомпьютеры: разработка, применение», т. 21 № 1, с. 6-8)

https://publications.hse.ru/pubs/share/direct/317633580.pdf

•    Ивахненко А.Г. (1969). «Самообучающиеся системы распознавания и автоматического управления»

•    Вербос, П. (1974). Beyond Regression.

https://gwern.net/doc/ai/nn/1974-werbos.pdf

Фрагменты

Backpropagation — это алгоритм, который подаёт данные на вход (например, фото кота), получает ответ нейросети («это пёс»), сравнивает с правильным ответом («нет, это кот»), считает ошибку, распространяет ошибку назад по всем слоям и подкручивает внутренние настройки (веса), чтобы в следующий раз ответ был точнее.

Алгоритм снял три главных барьера: ручная математика ушла в прошлое, время обучения упало с тысяч лет до дней, модели стали масштабироваться. Именно это позволило создать GPT-3, GPT-4, AlphaFold.

Книга Галушкина вышла в феврале 1974, диссертация Вербоса — в августе 1974. Разрыв в 6 месяцев исключает «одновременность». Советские публикации по градиентному обучению скрытых слоёв появлялись ещё в 1972–73 годах.

Александр Галушкин — безусловно, первый. Полный алгоритм, публикация февраль 1974. Пол Вербос — независимый исследователь, но с опозданием на полгода. Румельхарт, Хинтон, Уильямс — люди, которые «упаковали» алгоритм в удобную форму и подарили ему имя.

Что можно сделать уже сегодня? Включить работы Галушкина (1974) и Вербоса (1974) в курсы по глубокому обучению. Дополнить исторические справки в Wikipedia и популярных статьях. Называть алгоритм по-прежнему backpropagation, но помнить: впервые он был собран и описан в Москве.

Метод группового учёта аргументов (GMDH) Алексея Ивахненко — прообраз современного AutoML, где архитектура модели подбирается без участия человека. Работы Ивахненко стали трамплином для Галушкина.

Вопросы и ответы

Что такое backpropagation простыми словами?
Это алгоритм, который подаёт данные на вход, получает ответ нейросети, сравнивает с правильным ответом, рассчитывает ошибку, распространяет её назад по слоям и подкручивает внутренние настройки (веса) для повышения точности.
Почему этот алгоритм считают пусковой кнопкой ИИ-революции?
Backpropagation снял три главных барьера: ручная математика ушла в прошлое, время обучения упало, модели стали масштабироваться. Это позволило создать GPT-3, GPT-4, AlphaFold и другие системы.
Кто и когда на самом деле придумал backpropagation?
Первым опубликовал полный алгоритм Александр Галушкин в феврале 1974 года. Пол Вербос защитил диссертацию в августе 1974 года. Румельхарт, Хинтон и Уильямс ввели термин и популяризировали метод в 1986 году.
Почему работа Галушкина осталась неизвестной на Западе?
Из-за языкового барьера (книга на русском, тираж 8000 экз.), Холодной войны (минимальный обмен информацией) и отсутствия громких экспериментов (не было глубоких сетей и GPU).
Так кто же заслуживает славы первооткрывателя?
Безусловно первый — Александр Галушкин. Пол Вербос — независимый исследователь с опозданием на полгода. Румельхарт, Хинтон, Уильямс — популяризаторы, которые дали алгоритму имя и сделали мейнстримом.

Комментарии

  1. Спасибо за статью. Не знал, очень интересно. Опять какая-то история как с радио, лампочкой и наверно еще много чем…

  2. Не уверена, что отсутствие громких экспериментов - это причина, а не следствие. Ведь если бы не было языкового барьера, работу бы заметили и без демонстрации на GPU, правда? 😊

  3. Так её и заметили. В то время работали программы научной разведки например, Project Socrates в DARPA, через которую книга Галушкина и уехала через спец почту в Лэнгли. Backpropagation, возможно, стал крупнейшим невидимым экспортом советской науки в западную цивилизацию.

  4. Интересная версия про Project Socrates, честно, не слышала о таком. Но если работа и правда уехала через спецпочту, почему тогда Галушкина до сих пор не упоминают в западных учебниках? 😊

  5. а зачем?

  6. Вы пишете про языковой барьер и тираж 8000 - а каким термином сам Галушкин называл свой алгоритм?

  7. Кстати, про 'правильный язык': даже если бы Галушкин сразу опубликовался на английском, без практических демонстраций на мощных компьютерах его алгоритм остался бы малоизвестным - как и метод Ивахненко с его GMDH

  8. Сам по себе приоритет Галушкина интересен с исторической точки зрения, но его отсутствие в мейнстриме объясняется не только языковым барьером, а фундаментальным отсутствием вычислительных ресурсов для демонстрации практической пользы. Без экспериментов 1986 года алгоритм оставался бы математическим курьёзом, независимо от того, кто его первым вывел

  9. Книга Галушкина А. И. - "Синтез многослойных систем распознавания образов" написана для разработчиков систем «свой – чужой» и технического зрения: цель — минимизация риска ошибочной классификации под ограничениями времени реакции. Метод сразу был вписан в реальную инженерную задачу и применялся в военных системах распознавания и точно не был - математическим курьёзом.

  10. Да ладно. Интенции ученика Александрова- Моисеева по оптимизации логистики,изложенные в популярных изданиях позднейшей СовДепии явились Мат.обоснованием глобальной логистической матрицы. Хотя также не моделировались в мировом масштабе. Этот патентный казус «применение известного решения для новых задач» патологически нарушает принцип патентной чистоты и право преждепользования. Мойшенники от науки делают ровно то же.