Рубрики
Статьи/Блог

От трилобита до пространственного разума: эволюционный путь зрения и мыслящих машин

Фэй-Фэй Ли всегда интересно послушать, учитывая, что она пытается создать мировой AI-мозг, а Китай пытается создать мировой физический субстрат (материальную основу — роботов) для этого мозга. Фэй-Фэй Ли — выдающийся ученый в области компьютерных наук, профессор Стэнфордского университета и один из признанных первопроходцев и лидеров в сфере искусственного интеллекта и компьютерного зрения. В научном сообществе ее часто называют «крестной матерью искусственного интеллекта» за неоценимый вклад в развитие современных технологий машинного обучения. Фэй-Фэй Ли сейчас находится в довольно интересном положении: она фактически перешла из роли академического исследователя в роль предпринимателя, который пытается построить следующий слой AI после LLM. Ее компания называется World Labs. Главная идея World Labs — Spatial Intelligence, то есть пространственный интеллект.

В сентябре 2024 года World Labs привлекла $230 млн, получив оценку примерно $1 млрд. А 18 февраля 2026 года компания объявила о новом раунде на $1 млрд. Среди инвесторов — Nvidia, AMD, Autodesk, Fidelity, Emerson Collective и другие. Компанию оценивают в 5 млрд.

Что Фэй-Фэй Ли говорит в свежем интервью?

Зрение как главный двигатель эволюции жизни

Зрение появилось на Земле около 540 миллионов лет назад у простейших морских обитателей, таких как трилобиты. До этого у живых существ не было ни слуха, ни обоняния, ни развитой нервной системы, существовали лишь зачатки осязания. Появление первых светочувствительных клеток полностью изменило правила игры: организмы получили возможность активно искать пищу, спасаться от хищников и находить партнеров.

Этот мощный эволюционный толчок привел к невероятному событию — так называемому Кембрийскому взрыву, который произошел всего через 10 миллионов лет после появления первого зрения. За этот геологически короткий промежуток времени возникло колоссальное разнообразие видов животных. С тех пор зрение остается фундаментальным фактором выживания и развития сложнейшего интеллекта на нашей планете.

Доминирующая роль визуальной системы в человеческом мозге

Вся жизнь человека построена вокруг способности видеть, и это подтверждается физиологией нашего тела. Ученые подсчитали, что примерно половина активности коры головного мозга человека напрямую занята обработкой визуальной информации. Мы тратим огромные вычислительные ресурсы нашего биологического процессора на то, чтобы просто распознавать формы, цвета и движения вокруг нас.

Эта особенность отчетливо видна в развитии детей: младенцы начинают познавать мир визуально задолго до того, как осваивают речь. Способность ориентироваться в пространстве, распознавать лица родителей и классифицировать предметы глазами закладывается в мозге как базовый фундамент, на который позже накладываются все остальные когнитивные навыки, включая язык и логику.

Биологические корни искусственных нейросетей

Архитектура современных компьютерных нейросетей уходит корнями в открытие, сделанное нейробиологами в 1950-х годах. Тогда ученые обнаружили, что зрительные клетки в мозге млекопитающих выстроены в иерархическую структуру. Свет улавливается сетчаткой, а затем сигналы передаются по цепочке слоев, где каждый последующий уровень собирает простые штрихи и линии в сложные, законченные образы.

Хотя сегодняшние компьютерные алгоритмы разрослись до сотен миллиардов и даже триллионов параметров и сильно отдалились от реальной биологии, их базовый принцип остался прежним. Нейросети состоят из простых узлов, которые принимают сигналы, обрабатывают их с помощью несложных математических функций и передают дальше, воссоздавая ту самую многослойную структуру, подсмотренную у природы более полувека назад.

Критическая важность больших данных для обучения машин

В начале XXI века искусственный интеллект находился в тупике: ученые создавали разные алгоритмы, но они плохо справлялись с реальными задачами из-за микроскопического количества данных, которые им скармливали. Решением стало обращение к опыту развития человека. Оказалось, что обычный ребенок уже к шести годам способен без усилий различать десятки тысяч категорий предметов благодаря постоянному визуальному потоку.

Дети с рождения буквально купаются в океане зрительных образов, получая колоссальный объем информации каждую секунду. Именно гипотеза о том, что машинам для прорыва нужен аналогичный колоссальный поток данных, заставила исследователей в 2006 году полностью сменить фокус работы. Вместо бесконечного улучшения формул они сосредоточились на сборе гигантских массивов информации.

Революционный проект оцифровки мира под названием ImageNet

Реализацией идеи о необходимости больших данных стало создание грандиозной базы изображений, которая собиралась силами исследователей начиная с 2006 года. Этот проект объединил в себе 15 миллионов фотографий, разбитых по различным категориям повседневных объектов — от микрофонов до чашек и стульев. Проект стал фундаментом для обучения компьютеров пониманию окружающего мира.

С 2010 года эта база данных легла в основу ежегодного открытого соревнования для ученых со всего мира. Им предлагалось создать программу, способную правильно распознать объекты на тестовом наборе из более чем 1 миллиона изображений, распределенных по 1000 различных классов. Этот вызов заставил все научное сообщество переосмыслить подход к обучению машин.

Триединство, породившее современный искусственный интеллект

Настоящая революция в технологиях произошла в 2012 году благодаря мощному слиянию трех независимых факторов. Первым элементом стали созревшие алгоритмы глубоких нейросетей, вторым — появление колоссальной базы данных ImageNet, а третьим — развитие графических процессоров (GPU), способных параллельно выполнять огромные объемы вычислений с невероятной скоростью.

Без любого из этих компонентов прорыв был бы невозможен. Быстрые видеокарты дали вычислительную мощность, нейросети обеспечили гибкую математическую структуру, а миллионы картинок послужили идеальным учебником. Схождение этих трех факторов в одной временной точке навсегда изменило вектор развития компьютерных наук.

Сравнение возможностей человека и компьютера в распознавании образов

Человеческий мозг невероятно силен, но его возможности ограничены памятью и вниманием. При тестировании обычного человека на задаче распознавания 1000 классов предметов его уровень ошибок составил около 4%. Даже самый умный студент путается, когда нужно удержать в голове столько категорий одновременно или различить очень похожие породы собак.

В первые годы проведения технологических тестов машины сильно уступали человеку. Однако в переломном 2012 году уровень ошибок алгоритмов резко сократился, а уже к 2015–2016 годам компьютеры окончательно превзошли человека в этой задаче, показав точность выше человеческих 96%. Это доказало жизнеспособность выбранного пути развития систем.

Эффект открытых шлюзов для всех видов восприятия

Успех в распознавании изображений мгновенно перекинулся на другие области искусственного интеллекта. Как только исследователи поняли, что формула из правильного алгоритма, огромных данных и мощных видеокарт работает, они открыли шлюзы для обработки звуков, речи и текстов. Технологии начали развиваться со взрывной скоростью во всех направлениях сразу.

Сегодня эти методы позволяют решать сложнейшие задачи, которые раньше казались фантастикой. Например, ученые используют аналогичные алгоритмы для расшифровки и анализа сложных песен китов в океане. Распознавание человеческого голоса, интонаций и эмоций вышло на уровень, который навсегда изменил наше взаимодействие с техникой.

Переход от статичных картинок к пониманию физики движения

Следующий качественный скачок произошел в районе 2023 года, когда в качестве учебного материала для систем начали массово использовать видеоролики. Это позволило создать генераторы видео, способные по текстовому описанию создавать реалистичные сцены, например бегущую кошку. При этом компьютер совершенно не знает анатомии животных или законов биомеханики.

Машина учится на чистой статистике: просмотрев миллионы видеозаписей с кошками в интернете, она запоминает, как визуально выглядит правильное и правдоподобное движение лап и тела. Этот процесс во многом похож на то, как обычные люди понимают мир — мы тоже не знаем точного расположения мышц у животных, но безошибочно определяем естественность их движений по накопленному зрительному опыту.

Языковой тупик: настоящий интеллект укоренен в физическом пространстве, а не в словах

Сегодня весь мир охвачен лихорадкой вокруг текстовых чат-ботов и больших языковых моделей, в которые вливаются миллиарды долларов. Однако этот путь развития является красивым, но тупиковым ответвлением. Человечество ошибочно приравняло умение жонглировать словами к истинному разуму. Биологическая эволюция на Земле шла совершенно иначе: она потратила более 500 миллионов лет на развитие организмов в условиях абсолютного отсутствия вербального общения. На протяжении этого колоссального периода мозг живых существ развивался исключительно через физическое взаимодействие с трехмерным миром — умение избегать хищников, находить дорогу в пространстве и манипулировать предметами.

Настоящий, полноценный разум родится не из текстов в интернете, а из понимания физики реальности. Будущее технологий лежит в переходе от манипуляций со словами к освоению пространственного интеллекта. Для этого необходим запуск моделей нового поколения, способных оперировать полноценными трехмерными (3D) и четырехмерными (4D) интерактивными средами. Способность машины воссоздавать объемный мир по воображаемому эскизу или текстовому описанию — это не просто инструмент для индустрии развлечений, а создание фундамента для роботов будущего. Без понимания пространства любой искусственный интеллект останется лишь бесплотным калькулятором, полностью оторванным от физической реальности.

Ограниченность интернета как зеркала человеческого сознания

Современные большие модели кажутся всеведущими только потому, что обучены на интернете, который представляет собой гигантскую цифровую библиотеку человеческого поведения за последние десятилетия. В ней собрано все: от подростковой болтовни в чатах до сложнейших оцифрованных научных трудов, миллиардов фотографий и музыкальных произведений.

Однако интернет хранит лишь то, что люди смогли выразить и опубликовать. Огромная часть человеческого опыта — мимолетные эмоции, глубоко личные воспоминания, уникальные творческие озарения великих художников или сложные ассоциации — никогда не оцифровывалась. Модель не может воссоздать то, чего нет в ее обучающих данных, поэтому внутренний мир человека до сих пор остается для нее недосягаемой территорией.

Математические рамки компьютерного творчества

Иногда кажется, что машины способны на настоящее творчество, например, когда алгоритм совершает гениальный и непредсказуемый ход в сложнейшей настольной игре, который никогда не приходил в голову лучшим мастерам за тысячи лет. Но за этим фасадом скрывается сухая математика. Игра имеет жесткие правила и четкие математические цели, что позволяет машине просчитывать варианты на недоступной человеку глубине.

Это специфический вид креативности, ограниченный рамками заданных условий. Настоящее же человеческое творчество выходит далеко за пределы простого перебора вариантов: оно способно создавать новые правила, новые языки выражения и новые методы решения задач, которых раньше просто не существовало в природе и истории.

Симбиоз человека и машины в научной работе

Будущее великих открытий лежит не в замене человека компьютером, а в их тесном сотрудничестве. Человеческий мозг сильно ограничен физиологически: мы не можем помнить все медицинские исследования за последние сотни лет или одновременно разбираться во всех смежных науках. Искусственный интеллект может стать идеальным партнером, способным мгновенно синтезировать знания из абсолютно разных областей.

В то время как ученый удерживает общую картину, ставит гипотезы и направляет процесс с помощью своей интуиции, машина берет на себя рутинную обработку терабайтов данных и поиск неочевидных связей. Такое объединение человеческого воображения и вычислительной мощности компьютера позволит решать задачи, которые раньше казались абсолютно непреодолимыми.

Уязвимость алгоритмов перед уникальностью реального мира

Компьютерные системы безупречно работают только тогда, когда у них есть огромное количество похожих примеров для обучения. В реальной жизни, особенно в медицине, ситуации часто бывают уникальными. Например, при сложнейших операциях на печени хирурги сталкиваются с тем, что этот орган пронизан бесчисленным количеством сосудов, строение которых у каждого человека строго индивидуально.

Даже если собрать данные обо всех операциях на печени в мире, их все равно будет слишком мало для того, чтобы полностью автономный робот мог безопасно провести такое вмешательство. В подобных деликатных областях слепая вера в автоматику опасна, и наилучший результат дает только совместная работа опытного врача и высокотехнологичного инструмента.

Истинная интуиция против математического контекста

Когда мы общаемся с умной программой, она может давать очень точные и персонализированные ответы в зависимости от того, как мы себя назвали — профессором или подростком. Это выглядит как проявление чуткости или интуиции, но на самом деле это лишь математическая подстройка выдачи под заданные текстовые рамки, что в компьютерных науках называется контекстом.

Настоящая человеческая интуиция работает совсем иначе: она базируется на неосознаваемых физиологических сигналах нашего тела — гормонах, запахах, изменении пульса и тончайших оттенках настроения, которые мы сами не всегда можем облечь в слова. Пока у машин нет соответствующих датчиков, способных считывать эти биологические показатели, этот пласт человеческого понимания останется для них закрытым.

Фундаментальное различие между сочувствием и его имитацией

Если на фразу о болезни компьютер отвечает вежливым сожалением, он делает это не из чувства сострадания. Программа просто рассчитала статистическую вероятность того, какие слова должны следовать за сообщением о недуге на основе миллионов текстов из интернета. Машина не знает, что такое боль, и не имеет биологического опыта страданий.

Человеческое же сопереживание рождается из общего биологического опыта: когда близкий человек страдает, мы проецируем его боль на себя, вспоминая собственные чувства и искренне желая ему блага. Важно четко понимать эту границу и не приписывать бездушным алгоритмам человеческие чувства, чтобы не впадать в опасные иллюзии.

Необходимость жестких правил и общественного контроля над технологиями

Создатели технологий по своей природе стремятся двигаться вперед как можно быстрее, увлеченные азартом новых открытий. В истории науки бывали случаи, когда ученые из чистого любопытства пытались проводить опасные эксперименты, которые могли нанести непоправимый вред обществу. Это доказывает, что развитие технологий нельзя пускать на самотек.

Решение о том, как именно должны развиваться и использоваться технологии, не должно приниматься исключительно коммерческими компаниями или инвесторами, движимыми рыночными силами. Необходимо выстраивать жесткие профессиональные и этические нормы, законы и правила с привлечением всего общества, чтобы новые инструменты служили безопасности и процветанию людей, а не создавали новые угрозы.

Сохранение человеческой воли и роли учителей в новую эпоху

Самым опасным последствием бесконтрольного использования новых технологий может стать потеря людьми собственной воли, любознательности и желания учиться самостоятельно. Если человек привыкает лишь пассивно потреблять бесконечный поток коротких видеороликов или бездумно списывать ответы у бота, его мозг лишается необходимой развивающей нагрузки.

Технологии должны быть умными помощниками, которые помогают нам учиться глубже и быстрее, а не заменяют сам процесс мышления. В этом процессе ключевую роль играют школьные учителя и родители, которых незаслуженно обходят вниманием создатели ИТ-индустрии. Наша главная задача — поддерживать и снабжать ресурсами преподавателей, ведь именно они помогают молодому поколению сохранять мотивацию, развивать волю и становиться умнее с помощью новых инструментов.

Конец эпохи «ленивого общения» и новая этика человеческих отношений

Появление мыслящих машин неожиданно нанесло сокрушительный удар по привычным социальным привычкам людей, обнажив проблему «ленивых вопросов». Всю свою историю человечество жило в режиме коммуникативного паразитизма: сталкиваясь с малейшей интеллектуальной трудностью, человек предпочитал не тратить собственные силы на размышления или поиск информации, а сразу шел с расспросами к коллеге, другу или близкому, которого считал умнее. В новой реальности, когда доступ к любым знаниям мира стал мгновенным и бесплатным, такое поведение стремительно превращается в грубое нарушение этикета и неуважение к чужому времени.

Новая технологическая эпоха заставляет людей полностью перестроить культуру общения и стать более самостоятельными. Задавать другому человеку вопрос, ответ на который машина может выдать за долю секунды — это проявление ментальной лени. Человек должен сначала проделать внутреннюю работу: четко сформулировать свой запрос к искусственному разуму, проанализировать первичную информацию и прийти к живому собеседнику уже подготовленным. К людям стоит обращаться не за сухими фактами, а за тем, что машина дать не способна — за живыми эмоциями, глубоким личным опытом и душевным теплом. Это полностью очистит человеческое общение от рутины, оставив его исключительно для искренней близости.

**

Фэй-Фэй Ли отжигает

https://t.me/fastsalttimes/2966

**