Эдисон запатентовал фонограф в феврале 1878 года. В первой же публичной статье он описал десять применений своего изобретения. Первое — диктовка и деловая переписка без помощи стенографа.
То, что мы сейчас называем речевой аналитикой, было сформулировано как задача 147 лет назад.
Почему же коммерческие системы расшифровки речи появились только в 1990-х, а по-настоящему заработали лишь в 2020-х? Что случилось между 1878 и 2025 годом? Ответ на этот вопрос даёт концепт, который придумал биолог Стюарт Кауфман и применил к истории технологий Стивен Джонсон. Концепт называется «смежное возможное».
Он объясняет не только, почему фонограф стал патефоном, а не офисным инструментом. Он объясняет, что происходит сейчас с AI — и почему ускорение последних двух лет выглядит именно так, как оно выглядит.
То, что мы сейчас называем речевой аналитикой, было сформулировано как задача 147 лет назад.
Почему же коммерческие системы расшифровки речи появились только в 1990-х, а по-настоящему заработали лишь в 2020-х? Что случилось между 1878 и 2025 годом? Ответ на этот вопрос даёт концепт, который придумал биолог Стюарт Кауфман и применил к истории технологий Стивен Джонсон. Концепт называется «смежное возможное».
Он объясняет не только, почему фонограф стал патефоном, а не офисным инструментом. Он объясняет, что происходит сейчас с AI — и почему ускорение последних двух лет выглядит именно так, как оно выглядит.
Как Кауфман описал эволюцию и почему это работает для технологий
Стюарт Кауфман — теоретический биолог, один из пионеров теории сложных систем. В книге «At Home in the Universe» (1995) и затем в «Investigations» (2000) он сформулировал идею, которую назвал «adjacent possible» — смежное, или соседнее, возможное.
В биологии концепт описывает следующее. В любой момент эволюции существует не бесконечное, а строго ограниченное множество изменений, которые могут произойти. Клетка не может за один шаг превратиться во что угодно. Она может сделать только то, для чего у неё уже есть молекулярные «соседи» — химические реакции, готовые произойти при малейшем изменении конфигурации. Следующий шаг возможен только из текущего состояния, а не из любого произвольного состояния системы.
Кауфман на странице в Edge.org описывал это так: биосфера расширяет своё смежное возможное настолько быстро, насколько может поддержать новую сложность. Каждый реализованный шаг открывает новые соседние шаги, которых раньше не существовало.
Стивен Джонсон в книге «Where Good Ideas Come From» (2010) взял этот концепт и перевёл его в язык инноваций. Он показал: технологические изобретения подчиняются той же логике, что и эволюция. eBay невозможно было создать в 1950-х — не потому что идея была плохой, а потому что не было ни персональных компьютеров, ни интернета, ни платёжных систем. Каждого из этих компонентов не существовало. Когда все три появились и накопились — нужная дверь открылась почти мгновенно.
Механизм простой. В каждый момент времени существует набор технологий, практик и инфраструктуры — это «текущая комната». Из неё видны соседние двери, за которыми стоят следующие возможности. Но за дверями дальше, чем одна комната, — темнота. Туда нельзя попасть без промежуточных шагов.
Самолёт нельзя было изобрести в XVIII веке. Идея полётных аппаратов тяжелее воздуха существовала давно — Леонардо да Винчи, например, делал эскизы летательных машин ещё в XV веке. Но без двигателей внутреннего сгорания, без металлургии, позволяющей делать лёгкие жёсткие конструкции, без достаточного понимания аэродинамики — никакой самолёт не полетит. Братья Райт в 1903 году оказались в нужной комнате: двигатели уже существовали, материалы стали достаточно лёгкими, а базовая теория подъёмной силы — изученной.
Из этого следует важный, хотя и неочевидный вывод. Многие технологии формулируются правильно — по задаче, по принципу, по применению — за десятки и сотни лет до того, как реально начинают работать. Идея верна. Компонентов нет.
В биологии концепт описывает следующее. В любой момент эволюции существует не бесконечное, а строго ограниченное множество изменений, которые могут произойти. Клетка не может за один шаг превратиться во что угодно. Она может сделать только то, для чего у неё уже есть молекулярные «соседи» — химические реакции, готовые произойти при малейшем изменении конфигурации. Следующий шаг возможен только из текущего состояния, а не из любого произвольного состояния системы.
Кауфман на странице в Edge.org описывал это так: биосфера расширяет своё смежное возможное настолько быстро, насколько может поддержать новую сложность. Каждый реализованный шаг открывает новые соседние шаги, которых раньше не существовало.
Стивен Джонсон в книге «Where Good Ideas Come From» (2010) взял этот концепт и перевёл его в язык инноваций. Он показал: технологические изобретения подчиняются той же логике, что и эволюция. eBay невозможно было создать в 1950-х — не потому что идея была плохой, а потому что не было ни персональных компьютеров, ни интернета, ни платёжных систем. Каждого из этих компонентов не существовало. Когда все три появились и накопились — нужная дверь открылась почти мгновенно.
Механизм простой. В каждый момент времени существует набор технологий, практик и инфраструктуры — это «текущая комната». Из неё видны соседние двери, за которыми стоят следующие возможности. Но за дверями дальше, чем одна комната, — темнота. Туда нельзя попасть без промежуточных шагов.
Самолёт нельзя было изобрести в XVIII веке. Идея полётных аппаратов тяжелее воздуха существовала давно — Леонардо да Винчи, например, делал эскизы летательных машин ещё в XV веке. Но без двигателей внутреннего сгорания, без металлургии, позволяющей делать лёгкие жёсткие конструкции, без достаточного понимания аэродинамики — никакой самолёт не полетит. Братья Райт в 1903 году оказались в нужной комнате: двигатели уже существовали, материалы стали достаточно лёгкими, а базовая теория подъёмной силы — изученной.
Из этого следует важный, хотя и неочевидный вывод. Многие технологии формулируются правильно — по задаче, по принципу, по применению — за десятки и сотни лет до того, как реально начинают работать. Идея верна. Компонентов нет.
Бабидж, фонограф и «отложенные гипотезы»
Аналитическая машина Чарльза Бэббиджа — один из самых красноречивых примеров «доопережающего» изобретения. В 1830-х годах Бэббидж спроектировал полноценный программируемый компьютер с памятью, процессором и условными переходами. Концептуально он был абсолютно верен. Машина просто не могла быть построена — викторианская точность механической обработки металлов не позволяла изготовить десятки тысяч деталей с допусками в тысячные доли дюйма. Современные симуляции показывают: идея работала. Компонент был недоступен.
Фонограф Эдисона — история более конкретная и более прямо связанная с тем, что мы называем речевой аналитикой сегодня.
19 февраля 1878 года Томас Эдисон получил патент на фонограф — цилиндрический барабан, способный записывать и воспроизводить звук. В июне того же года в журнале North American Review он опубликовал статью «The Phonograph and Its Future» с перечнем десяти будущих применений своего изобретения.
Первым пунктом шло следующее: «Letter writing and all kinds of dictation without the aid of a stenographer» — переписка и все виды диктовки без помощи стенографа. Библиотека Конгресса США подтверждает: Эдисон изначально видел фонограф именно как офисный инструмент. Музыкальные пластинки появились позже и оказались куда более массовым применением — но это не был изначальный замысел.
Почему офисный инструмент не получился?
Машина умела одно: сохранять звук. Чтобы превратить запись в текст, всё равно нужен был человек. Стенограф слушал запись и расшифровывал её вручную — производительность труда вырастала незначительно. Разрыв между «записать звук» и «извлечь смысл из звука» оставался пропастью.
Задача была правильно сформулирована. Компонент — автоматическое распознавание речи — отсутствовал.
Фонограф Эдисона — история более конкретная и более прямо связанная с тем, что мы называем речевой аналитикой сегодня.
19 февраля 1878 года Томас Эдисон получил патент на фонограф — цилиндрический барабан, способный записывать и воспроизводить звук. В июне того же года в журнале North American Review он опубликовал статью «The Phonograph and Its Future» с перечнем десяти будущих применений своего изобретения.
Первым пунктом шло следующее: «Letter writing and all kinds of dictation without the aid of a stenographer» — переписка и все виды диктовки без помощи стенографа. Библиотека Конгресса США подтверждает: Эдисон изначально видел фонограф именно как офисный инструмент. Музыкальные пластинки появились позже и оказались куда более массовым применением — но это не был изначальный замысел.
Почему офисный инструмент не получился?
Машина умела одно: сохранять звук. Чтобы превратить запись в текст, всё равно нужен был человек. Стенограф слушал запись и расшифровывал её вручную — производительность труда вырастала незначительно. Разрыв между «записать звук» и «извлечь смысл из звука» оставался пропастью.
Задача была правильно сформулирована. Компонент — автоматическое распознавание речи — отсутствовал.
Семьдесят лет от записи до распознавания
История того, как этот компонент появился, занимает почти столетие. Это история о последовательном открытии соседних дверей.
1952 год. Audrey, Bell Labs. Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания произносимых цифр одного говорящего. Система работала с акустическими отпечатками — она искала характерные звуковые паттерны, называемые формантами. Audrey умела распознавать числа от 0 до 9 и только голос обученного оператора. Это был первый рабочий прототип, доказавший принцип.
1962 год. IBM Shoebox, Всемирная выставка. IBM представила машину, умевшую распознавать 16 слов: цифры от 0 до 9 плюс команды plus, minus, false, total, subtotal и off. Главным предназначением была устная арифметика. Выступление на Всемирной выставке в Сиэтле произвело впечатление, однако коммерческой технологии из Shoebox не вышло. Словарь в 16 слов был слишком мал для любого делового применения.
1990 год. Dragon Dictate. Первый коммерческий продукт для автоматической расшифровки речи с реальным словарём. Dragon Dictate продавался за $9 000 и предлагал словарь из 80 000 слов — но требовал произносить каждое слово отдельно, с паузами. Это была уже рабочая технология, но крайне ограниченная в скорости и неудобная. Быстрые процессоры сделали её возможной — это был компонент, который до 1990-х просто не существовал в потребительском сегменте.
От 1878 до 1990 года — 112 лет от правильно сформулированной задачи до первого коммерческого решения.
И всё же в 1990-х и 2000-х речевая аналитика в понимании Эдисона — массовый офисный инструмент, извлекающий смысл из разговоров — по-прежнему не существовала. Потому что распознавание речи и понимание речи — разные вещи.
Распознать — значит превратить звук в набор слов. Понять — значит извлечь из этих слов структурированную информацию: о чём был разговор, что хотел говорящий, что пошло не так, какое следующее действие нужно предпринять. Второй компонент дозревал дольше.
1952 год. Audrey, Bell Labs. Стивен Балашек, Р. Биддалф и К. Х. Дэвис создали систему Audrey для распознавания произносимых цифр одного говорящего. Система работала с акустическими отпечатками — она искала характерные звуковые паттерны, называемые формантами. Audrey умела распознавать числа от 0 до 9 и только голос обученного оператора. Это был первый рабочий прототип, доказавший принцип.
1962 год. IBM Shoebox, Всемирная выставка. IBM представила машину, умевшую распознавать 16 слов: цифры от 0 до 9 плюс команды plus, minus, false, total, subtotal и off. Главным предназначением была устная арифметика. Выступление на Всемирной выставке в Сиэтле произвело впечатление, однако коммерческой технологии из Shoebox не вышло. Словарь в 16 слов был слишком мал для любого делового применения.
1990 год. Dragon Dictate. Первый коммерческий продукт для автоматической расшифровки речи с реальным словарём. Dragon Dictate продавался за $9 000 и предлагал словарь из 80 000 слов — но требовал произносить каждое слово отдельно, с паузами. Это была уже рабочая технология, но крайне ограниченная в скорости и неудобная. Быстрые процессоры сделали её возможной — это был компонент, который до 1990-х просто не существовал в потребительском сегменте.
От 1878 до 1990 года — 112 лет от правильно сформулированной задачи до первого коммерческого решения.
И всё же в 1990-х и 2000-х речевая аналитика в понимании Эдисона — массовый офисный инструмент, извлекающий смысл из разговоров — по-прежнему не существовала. Потому что распознавание речи и понимание речи — разные вещи.
Распознать — значит превратить звук в набор слов. Понять — значит извлечь из этих слов структурированную информацию: о чём был разговор, что хотел говорящий, что пошло не так, какое следующее действие нужно предпринять. Второй компонент дозревал дольше.
Три компонента, которые наконец сошлись
В начале 2020-х три компонента — запись звука, распознавание речи в текст и извлечение смысла из текста — наконец сошлись в единый контур. Не по отдельности, как раньше, а как работающая система.
Запись была решена ещё с Эдисона. Высококачественное распознавание речи — в 2010-е годы, когда статистические модели достигли приемлемой точности. Но извлечение смысла — разметка, классификация, обнаружение паттернов, ответы на содержательные вопросы — стало массово доступным только с появлением больших языковых моделей.
До 2022 года сценарий был таким: звонок записан, транскрибирован — и дальше человек сам читал текст и думал. Или система искала ключевые слова по заданному списку — «скидка», «претензия», «конкурент» — и выдавала примитивную статистику. Это был не смысл, а поверхностный поиск.
С языковыми моделями появилась возможность задавать содержательные вопросы к тексту разговора: «Упомянул ли менеджер следующий шаг?», «Как клиент отреагировал на цену — согласился, попросил скидку или завершил разговор?», «Какие темы поднимал клиент, не входящие в скрипт?». Ответы стали содержательными — не по ключевым словам, а по смыслу.
Это и есть момент схождения трёх компонентов. Комната, в которую мы наконец вошли, — та самая, которую Эдисон описал в 1878 году.
Запись была решена ещё с Эдисона. Высококачественное распознавание речи — в 2010-е годы, когда статистические модели достигли приемлемой точности. Но извлечение смысла — разметка, классификация, обнаружение паттернов, ответы на содержательные вопросы — стало массово доступным только с появлением больших языковых моделей.
До 2022 года сценарий был таким: звонок записан, транскрибирован — и дальше человек сам читал текст и думал. Или система искала ключевые слова по заданному списку — «скидка», «претензия», «конкурент» — и выдавала примитивную статистику. Это был не смысл, а поверхностный поиск.
С языковыми моделями появилась возможность задавать содержательные вопросы к тексту разговора: «Упомянул ли менеджер следующий шаг?», «Как клиент отреагировал на цену — согласился, попросил скидку или завершил разговор?», «Какие темы поднимал клиент, не входящие в скрипт?». Ответы стали содержательными — не по ключевым словам, а по смыслу.
Это и есть момент схождения трёх компонентов. Комната, в которую мы наконец вошли, — та самая, которую Эдисон описал в 1878 году.
Что Epoch AI зафиксировал в 2024 году
Ускорение AI в последние два года — это не маркетинговый нарратив. Его зафиксировали измерениями.
Исследовательская организация Epoch AI отслеживает прогресс в возможностях языковых моделей по нескольким независимым метрикам. В апреле 2024 года они опубликовали данные: лучший результат на индексе Epoch Capabilities Index рос почти вдвое быстрее в последние два года по сравнению с двумя предыдущими. Ускорение составило около 90%. Три из четырёх измеряемых метрик показали статистически значимое ускорение — особенно в программировании и математике.
Что именно это ускорило? Появление reasoning models — моделей, которые не просто генерируют текст, но и последовательно рассуждают, проверяя промежуточные шаги. Выход OpenAI o1 установил масштабирование вычислений на этапе инференса (то есть в момент ответа, а не только при обучении) как новый вектор развития. Оказалось, что «думать дольше» работает — и это открыло новую дверь.
По данным MMLU — одного из стандартных академических бенчмарков — точность языковых моделей выросла с 70% в 2022 году до более 90% в 2025-м. Параллельно появились мультиагентные системы: это не одна модель, а несколько специализированных агентов, каждый из которых решает свою часть задачи и передаёт результат следующему. AutoGPT, Microsoft AutoGen, OpenAI Operator — примеры из 2024–2025 годов. Модель, которая нанимает себе в помощники ещё десять моделей и вместе они решают задачу, которая казалась невозможной три месяца назад, — это уже не метафора. Это описание конкретных инструментов.
PwC в опросе компаний, внедривших AI-агентов в 2025 году, зафиксировала: 66% отчитались о росте производительности, 57% — о снижении затрат. Скорость открытия соседних дверей сейчас измеряется кварталами, а не десятилетиями.
Исследовательская организация Epoch AI отслеживает прогресс в возможностях языковых моделей по нескольким независимым метрикам. В апреле 2024 года они опубликовали данные: лучший результат на индексе Epoch Capabilities Index рос почти вдвое быстрее в последние два года по сравнению с двумя предыдущими. Ускорение составило около 90%. Три из четырёх измеряемых метрик показали статистически значимое ускорение — особенно в программировании и математике.
Что именно это ускорило? Появление reasoning models — моделей, которые не просто генерируют текст, но и последовательно рассуждают, проверяя промежуточные шаги. Выход OpenAI o1 установил масштабирование вычислений на этапе инференса (то есть в момент ответа, а не только при обучении) как новый вектор развития. Оказалось, что «думать дольше» работает — и это открыло новую дверь.
По данным MMLU — одного из стандартных академических бенчмарков — точность языковых моделей выросла с 70% в 2022 году до более 90% в 2025-м. Параллельно появились мультиагентные системы: это не одна модель, а несколько специализированных агентов, каждый из которых решает свою часть задачи и передаёт результат следующему. AutoGPT, Microsoft AutoGen, OpenAI Operator — примеры из 2024–2025 годов. Модель, которая нанимает себе в помощники ещё десять моделей и вместе они решают задачу, которая казалась невозможной три месяца назад, — это уже не метафора. Это описание конкретных инструментов.
PwC в опросе компаний, внедривших AI-агентов в 2025 году, зафиксировала: 66% отчитались о росте производительности, 57% — о снижении затрат. Скорость открытия соседних дверей сейчас измеряется кварталами, а не десятилетиями.
Почему «не получилось полгода назад» и «это невозможно» — разные вещи
Вокруг AI много обещаний с конца 2022 года: «заменит колл-центр», «заменит врача», «заменит юриста». Часть этих обещаний правильно формулирует задачу. Но «соседние двери» для каждой задачи открыты по-разному.
Автоматизация простых повторяющихся разговоров в сервисе — дверь, которая открылась в 2023–2024 годах. Замена врача в диагностике — дверь, рядом с которой ещё нет нескольких нужных компонентов: регуляторной базы, отработанных протоколов ответственности, достаточной точности в специфических медицинских сценариях.
Юридическая работа — между этими крайностями, и разные виды юридических задач открылись в разные моменты.
Правило, которое здесь работает: задача сформулирована правильно, но нужно спрашивать не «можно ли это сделать в принципе», а «все ли компоненты уже доступны». Если один компонент отсутствует — технология не заработает, как бы правильно ни была сформулирована задача.
Это полезная рамка для бизнеса, который смотрит на AI без иллюзий. Есть гипотезы, которые раньше не проверялись — потому что компонента не было. Качественной транскрибации на русском языке по приемлемой цене ещё три-четыре года назад не существовало. Языковых моделей, способных осмысленно анализировать структуру разговора на русском, — тоже. Теперь оба компонента есть.
Значит, гипотезы, которые откладывались три года назад, сейчас можно достать и проверить.
Автоматизация простых повторяющихся разговоров в сервисе — дверь, которая открылась в 2023–2024 годах. Замена врача в диагностике — дверь, рядом с которой ещё нет нескольких нужных компонентов: регуляторной базы, отработанных протоколов ответственности, достаточной точности в специфических медицинских сценариях.
Юридическая работа — между этими крайностями, и разные виды юридических задач открылись в разные моменты.
Правило, которое здесь работает: задача сформулирована правильно, но нужно спрашивать не «можно ли это сделать в принципе», а «все ли компоненты уже доступны». Если один компонент отсутствует — технология не заработает, как бы правильно ни была сформулирована задача.
Это полезная рамка для бизнеса, который смотрит на AI без иллюзий. Есть гипотезы, которые раньше не проверялись — потому что компонента не было. Качественной транскрибации на русском языке по приемлемой цене ещё три-четыре года назад не существовало. Языковых моделей, способных осмысленно анализировать структуру разговора на русском, — тоже. Теперь оба компонента есть.
Значит, гипотезы, которые откладывались три года назад, сейчас можно достать и проверить.
Речевая аналитика как закрытая задача Эдисона
Если вернуться к фонографу — история речевой аналитики приобретает неожиданную завершённость.
Эдисон в 1878 году сформулировал задачу: автоматически фиксировать и обрабатывать деловые коммуникации так, чтобы не зависеть от ручного труда стенографа. Машина записывает, система понимает, бизнес получает структурированный результат.
До 2020-х это работало в самом приблизительном смысле. Записать — да. Транскрибировать — да, но с ошибками и дорого. Понять, что именно произошло в разговоре и что с этим делать, — нет.
Сейчас — да, и это принципиально иная ситуация.
Контакт-центр или отдел продаж с платформой речевой аналитики получает не просто транскрипты. Получает ответы на вопросы, которые руководителю раньше нужно было получать через выборочное прослушивание: «На каком этапе разговора чаще всего уходит клиент?», «Какие возражения менеджеры не закрывают?», «Есть ли паттерн у тех разговоров, которые заканчиваются продажей, — и чем он отличается от разговоров, которые заканчиваются отказом?»
Это именно то, что Эдисон называл «диктовкой без помощи стенографа» — только на 147 лет позже и на несколько порядков мощнее, чем он мог себе представить.
Важно понимать: речевая аналитика — это не «AI вместо человека». Это AI + человек. Система не принимает управленческие решения. Она извлекает из ста процентов разговоров структурированную информацию, которую раньше можно было получить только из одного-двух процентов разговоров через ручное прослушивание. Руководитель или аналитик интерпретирует эту информацию и принимает решение. Что поменять в скрипте. Кому из менеджеров нужна дополнительная работа над возражениями. Какой продукт клиенты спрашивают, но не находят в ответах.
Это не замена человека. Это расширение того, что человек может видеть.
Эдисон в 1878 году сформулировал задачу: автоматически фиксировать и обрабатывать деловые коммуникации так, чтобы не зависеть от ручного труда стенографа. Машина записывает, система понимает, бизнес получает структурированный результат.
До 2020-х это работало в самом приблизительном смысле. Записать — да. Транскрибировать — да, но с ошибками и дорого. Понять, что именно произошло в разговоре и что с этим делать, — нет.
Сейчас — да, и это принципиально иная ситуация.
Контакт-центр или отдел продаж с платформой речевой аналитики получает не просто транскрипты. Получает ответы на вопросы, которые руководителю раньше нужно было получать через выборочное прослушивание: «На каком этапе разговора чаще всего уходит клиент?», «Какие возражения менеджеры не закрывают?», «Есть ли паттерн у тех разговоров, которые заканчиваются продажей, — и чем он отличается от разговоров, которые заканчиваются отказом?»
Это именно то, что Эдисон называл «диктовкой без помощи стенографа» — только на 147 лет позже и на несколько порядков мощнее, чем он мог себе представить.
Важно понимать: речевая аналитика — это не «AI вместо человека». Это AI + человек. Система не принимает управленческие решения. Она извлекает из ста процентов разговоров структурированную информацию, которую раньше можно было получить только из одного-двух процентов разговоров через ручное прослушивание. Руководитель или аналитик интерпретирует эту информацию и принимает решение. Что поменять в скрипте. Кому из менеджеров нужна дополнительная работа над возражениями. Какой продукт клиенты спрашивают, но не находят в ответах.
Это не замена человека. Это расширение того, что человек может видеть.
Как использовать концепт в работе
Концепт «смежного возможного» полезен не только как исторический фрейм. Он даёт конкретный инструмент для оценки AI-новостей и собственных гипотез.
Шаг первый. Когда вы видите новость об очередном AI-сервисе или возможности, попробуйте мысленно разобрать задачу на компоненты. Что нужно, чтобы это работало? Какой компонент ключевой — и он уже существует или только обещается?
Шаг второй. Покопайтесь в собственных «отложенных гипотезах». Это идеи, которые вы или ваша команда отложили — не потому что задача была плохой, а потому что нужный инструмент или данные были недоступны. «Мы пробовали анализировать звонки — было слишком дорого и неточно». «Мы хотели автоматически отслеживать, как менеджеры закрывают возражения — но системы не было». «Мы думали об автозаполнении карт пациентов во время приёма — но транскрибация была слишком медленной и дорогой».
Каждая из этих формулировок — потенциально «отложенная гипотеза», которую стоит достать и перепроверить. Компонент мог появиться — и то, что не работало полгода или два года назад, сейчас может быть реализуемо.
Шаг третий. Помните о различии между «задача правильно сформулирована» и «все компоненты уже есть». Это спасает от двух крайностей: от хайпа («AI всё заменит немедленно») и от избыточного скептицизма («это невозможно»). Большинство разумных AI-применений — где-то посередине: задача правильная, но открытие нужной двери — дело конкретного момента, а не абстрактного будущего.
Быть точным в этом различии — значит принимать более качественные решения о том, куда инвестировать время и ресурсы.
Шаг первый. Когда вы видите новость об очередном AI-сервисе или возможности, попробуйте мысленно разобрать задачу на компоненты. Что нужно, чтобы это работало? Какой компонент ключевой — и он уже существует или только обещается?
Шаг второй. Покопайтесь в собственных «отложенных гипотезах». Это идеи, которые вы или ваша команда отложили — не потому что задача была плохой, а потому что нужный инструмент или данные были недоступны. «Мы пробовали анализировать звонки — было слишком дорого и неточно». «Мы хотели автоматически отслеживать, как менеджеры закрывают возражения — но системы не было». «Мы думали об автозаполнении карт пациентов во время приёма — но транскрибация была слишком медленной и дорогой».
Каждая из этих формулировок — потенциально «отложенная гипотеза», которую стоит достать и перепроверить. Компонент мог появиться — и то, что не работало полгода или два года назад, сейчас может быть реализуемо.
Шаг третий. Помните о различии между «задача правильно сформулирована» и «все компоненты уже есть». Это спасает от двух крайностей: от хайпа («AI всё заменит немедленно») и от избыточного скептицизма («это невозможно»). Большинство разумных AI-применений — где-то посередине: задача правильная, но открытие нужной двери — дело конкретного момента, а не абстрактного будущего.
Быть точным в этом различии — значит принимать более качественные решения о том, куда инвестировать время и ресурсы.
Итоги
Смежное возможное — не просто красивая метафора из биологии. Это описание механизма, по которому работают технологические переходы. Понимание этого механизма объясняет и историю, и то, что происходит прямо сейчас.
Эдисон правильно назвал задачу в 1878 году. Два ключевых компонента — автоматическое распознавание и понимание речи — созревали 112 и 144 года соответственно. Бэббидж правильно описал компьютер в 1830-х, но нужная точность механической обработки появилась только с электроникой — через сто лет.
AI в 2020-х переживает момент, когда сразу несколько компонентов — массовые языковые модели, мультиагентные системы, дешёвая транскрибация, понимание контекста в неструктурированных текстах — появились в доступном для бизнеса виде за очень короткое время. Epoch AI измерил это ускорение: 90% прирост скорости прогресса к апрелю 2024 года. Это не ощущение — это данные.
Для бизнеса это означает: сейчас хорошее время для «инвентаризации отложенных гипотез». Тех идей, которые не заработали раньше из-за нехватки одного компонента. Компонент мог появиться — и тогда правильно сформулированная задача наконец становится реализуемой.
Различие между «не получилось полгода назад» и «это невозможно в принципе» — одно из самых практически важных различий, которые стоит держать в голове при работе с AI-инструментами сегодня.
Эдисон правильно назвал задачу в 1878 году. Два ключевых компонента — автоматическое распознавание и понимание речи — созревали 112 и 144 года соответственно. Бэббидж правильно описал компьютер в 1830-х, но нужная точность механической обработки появилась только с электроникой — через сто лет.
AI в 2020-х переживает момент, когда сразу несколько компонентов — массовые языковые модели, мультиагентные системы, дешёвая транскрибация, понимание контекста в неструктурированных текстах — появились в доступном для бизнеса виде за очень короткое время. Epoch AI измерил это ускорение: 90% прирост скорости прогресса к апрелю 2024 года. Это не ощущение — это данные.
Для бизнеса это означает: сейчас хорошее время для «инвентаризации отложенных гипотез». Тех идей, которые не заработали раньше из-за нехватки одного компонента. Компонент мог появиться — и тогда правильно сформулированная задача наконец становится реализуемой.
Различие между «не получилось полгода назад» и «это невозможно в принципе» — одно из самых практически важных различий, которые стоит держать в голове при работе с AI-инструментами сегодня.
Хотите проверить свои «отложенные гипотезы»?
В imot.io мы работаем с компаниями, которые хотят понять, что именно из разговоров с клиентами и внутри команды поддаётся автоматическому анализу уже сейчас — и что ещё требует времени. Это честный разговор о том, что работает, а что пока только обещается.
Если у вас есть задача, которая раньше не решалась — напишите нам. Разберёмся, открылась ли нужная дверь.
Если у вас есть задача, которая раньше не решалась — напишите нам. Разберёмся, открылась ли нужная дверь.
Источники
Stuart Kauffman — The Adjacent Possible, Edge.org
Stuart Kauffman — «At Home in the Universe» (1995), Oxford University Press; «Investigations» (2000), Oxford University Press
Steven Johnson — «Where Good Ideas Come From: The Natural History of Innovation» (2010), Riverhead Books
Thomas Edison — «The Phonograph and Its Future», North American Review, June 1878 (JSTOR)
History of the Cylinder Phonograph — Library of Congress, History of Edison Sound Recordings
Thomas Edison patents the phonograph, February 19, 1878 — History.com
Speech Recognition from Audrey to Alexa — A Brief History — Dictate-IT
Speech Recognition Through the Decades: How We Ended Up With Siri — PCWorld
A Brief History of ASR: Automatic Speech Recognition — Sonix
AI capabilities progress has sped up — Epoch AI, April 2024
Have AI Capabilities Accelerated? — Epoch AI
Multi-AI Agents Systems in 2025: Key Insights, Examples, and Challenges — Ioni.ai
Babbage’s Analytical Engine: Unready 19th-Century Computer — Thought Hatch
AI Benchmarks 2025: Performance Metrics Show Record Gains — SentiSight.ai