В Waymo проект в области искусственного интеллекта считается готовым только после проведения его оценки — то есть, когда модель демонстрирует хорошие результаты.
Карл Франзен
Немногие компании сталкиваются с такими высокими ставками при внедрении ИИ, как Waymo, компания по разработке беспилотных автомобилей, входящая в Alphabet и отделившаяся от Google. Ее модели не просто генерируют текст или автоматизируют внутренние задачи: они помогают автомобилям ориентироваться на непредсказуемых улицах, реагировать на действия водителей-людей и принимать мгновенные решения в реальном мире.
Однако методы, которые Waymo использует для управления этими рисками — непрерывная оценка, тщательно отобранные данные, человеческий контроль и четко определенные бизнес-результаты — предлагают более широкий спектр возможностей для предприятий, внедряющих агентов ИИ практически в любой отрасли.
Манаси Джоши, директор Waymo по разработке систем интеллекта и машинного обучения, объяснила на конференции VB Transform 2026, как компания, занимающаяся автономными транспортными средствами, обучает, тестирует и внедряет ИИ в больших масштабах. По данным компании, на сегодняшний день Waymo проехала более 220 миллионов миль в полностью автономном режиме, или «только с пассажиром», при этом количество серьезных травм в результате аварий было в 17 раз меньше, чем у водителей-людей на том же расстоянии.
Для достижения этих впечатляющих результатов, по словам Джоши, Waymo внедрила то, что она назвала «разработкой, основанной на оценке» или «разработкой, ориентированной на оценку», сделав оценку основной частью проектирования, а не окончательной проверкой, проводимой перед развертыванием.
«Степень зрелости наших проектов легко можно определить по уровню их зрелости, который они демонстрируют», — сказал Джоши.
На практике Waymo оценивает готовность проекта, в частности, путем анализа зрелости сопутствующих тестов. Такой подход имеет очевидные последствия для предприятий, разрабатывающих агентов по обслуживанию клиентов, помощников по программированию, финансовые системы или другие приложения на основе искусственного интеллекта: если компания не может надежно измерить производительность системы, она может быть не готова к ее внедрению в производство.
Оценки должны продолжаться и после запуска.
Джоши заявил, что значительная часть работы Waymo по обеспечению качества сместилась в сторону оценок, включая тесты, проводимые во время обучения моделей, после обучения, а также в рамках моделирования с разомкнутым и замкнутым контуром.
«Оценка — это не разовая задача для запуска модели», — сказала она.
Вместо этого Waymo рассматривает оценку как непрерывный процесс, охватывающий вождение, моделирование и проверку. Ее методология сочетает в себе наборы данных, показатели производительности и инфраструктуру, способную эффективно работать в масштабе.
Для крупных предприятий это означает, что тестирования агента перед запуском недостаточно. Команды должны продолжать оценивать его по мере изменения базовых моделей, бизнес-процессов, поведения пользователей и поступающих данных. Эти оценки также должны быть связаны с реальными результатами бизнеса, а не полагаться исключительно на общие отраслевые показатели.
Джоши предостерег, что достоверность измерений качества модели зависит от качества исходных данных для оценки. Поэтому Waymo сопоставляет свои заявления о производительности с информацией о свойствах наборов данных, используемых для тестирования ее систем.
Проверка редких и опасных случаев.
В основе иерархии оценки Waymo по-прежнему лежит одна важнейшая цель: безопасность.
Компания использует собственные данные о поездках, некоторые данные сторонних источников и реалистичные симуляции, которые позволяют протестировать ее системы в сценариях, охватывающих миллиарды синтетических миль. Ответственные за задачи выбирают специализированные данные и показатели для ситуаций, связанных с уязвимыми участниками дорожного движения, железнодорожными переездами, зонами строительства и другими сложными условиями.
Тот же принцип применим и за пределами автономного вождения. Предприятиям необходимо тестировать не только рутинные запросы, которые успешно обрабатываются их агентами, но и нестандартные ситуации, в которых ошибки могут привести к финансовым, юридическим, проблемам безопасности или ущербу для репутации.
Джоши подчеркнул, что Waymo не оставляет решения о выпуске полностью на усмотрение автоматизированных систем. Проверка готовности к производству включает в себя тщательный человеческий контроль, в то время как внутренние руководители по безопасности утверждают выпуски программного обеспечения и расширение зоны обслуживания.
«Это не полностью автоматизированный процесс, управляемый искусственным интеллектом, и в нем отсутствует человеческий контроль», — сказала она. «На кону человеческие жизни».
Эффективность не должна достигаться за счет надежности.
Компания Waymo сталкивается с еще одной проблемой, хорошо знакомой командам, занимающимся разработкой ИИ для предприятий: спрос на вычислительные мощности, хранилище данных, память и сетевые ресурсы растет быстрее, чем доступные ресурсы.
Компания стремится к повышению эффективности на всех этапах: от извлечения и хранения данных до распределенного обучения моделей, оптимизации моделей, моделирования и оценки. Она также делает упор на «эффективность данных», выбирая наиболее полезные примеры для обучения, вместо того чтобы рассматривать больший объем как изначально лучшее качество.
Компания Waymo начала использовать трансформеры в 2017 году, а затем расширила свою деятельность, включив в нее большие языковые модели, модели «зрение-язык» и модели «зрение-язык-действие». Джоши заявил, что в настоящее время компания использует генеративные мультимодальные модели в рамках своей стратегии построения базовых моделей.
Компания Waymo разделяет свои технологии между бортовыми системами внутри каждого транспортного средства и внешней инфраструктурой, используемой для разработки моделей, обработки данных и моделирования. Такое сочетание заставляет компанию оптимизировать как обработку данных в реальном времени, так и более крупные системы, поддерживающие ее.
Агентам необходима собственная оценка.
Компания Waymo также использует ИИ-агентов внутри компании в качестве инструментов повышения производительности для инженеров. Джоши сказал, что агенты помогают анализировать распределение данных, оценивать эффективность данных и выявлять проблемы, обнаруженные в телеметрии транспортных средств, результатах обучения и неудачных попытках оценки.
Цель состоит в том, чтобы ускорить исследовательскую работу, чтобы инженеры могли уделять больше времени принятию решений и решению сложных технических проблем. Но Waymo также оценивает этих агентов, чтобы убедиться, что они дают достоверные и точные результаты, а не отправляют сотрудников на непродуктивные пути.
Для руководителей предприятий главный урок, который преподала компания Waymo, заключается в том, что для внедрения агентного ИИ требуется нечто большее, чем просто выбор мощной модели. Организациям необходимы четко определенная цель, репрезентативные данные для оценки, непрерывное тестирование, инфраструктура, способная эффективно функционировать, и назначенные лица, принимающие решения, которые будут нести ответственность за развертывание.
«Завоевание доверия имеет первостепенное значение», — сказал Джоши.
Источник: venturebeat.com
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
