Архив рубрики ~Коротко из Telegram~

На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry,…

На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry,…
File 214

На конференции в Нидерландах Марко Казалена, представитель Microsoft/Azure AI Foundry, прочитал живую импровизированную лекцию о том, какие развилки (те самые «или/или») сейчас встают перед разработчиками агентов.

Первая тема — токономика: эпоха «безлимитного шведского стола» токенов закончилась, и Microsoft тихо (без объявления на конференции Build) обновила Model Router — систему, которая перед вызовом большой модели прогоняет запрос через быстрый классификатор и решает, отправить его в дешёвую nano-модель или в дорогую флагманскую. Router теперь поддерживает десятки моделей, включая внешние (GPT, Opus), и скоро появится кастомизируемый классификатор маршрутизации.

Дальше — семейство «headless IQ»-инструментов: Web IQ (быстрый и дешёвый поиск для агентов вместо Bing API), Foundry IQ (агентный RAG поверх нескольких источников unstructured-данных — по сути отдельный саб-агент, который сам решает, что искать и как это синтезировать), Fabric IQ (для структурированных данных, с выбором между прямым подключением агента к онтологии или использованием отдельного «дата-агента» с описаниями таблиц и примерами запросов) и Work IQ (headless-версия Outlook/Teams/SharePoint, которая может работать «от лица» пользователя или от лица агента с отдельной идентичностью).

Центральная мысль доклада — прежде чем строить нового агента, стоит спросить: а нельзя ли обойтись скиллом (промпт + немного кода), который просто подключится к уже существующему универсальному агенту вроде Copilot или Scout? Это дешевле и не раздувает контекстное окно лишними инструментами — но у скиллов пока нет нормального способа тестирования в масштабе, в отличие от полноценных агентов.

И последний важный сдвиг — в оценке качества агентов. Старые метрики (task completion, task adherence) говорят только «сделал ли агент хоть что-то похожее на задачу», но не «сделал ли он это правильно». Microsoft переходит на rubric-based evaluation — наборы бизнес-специфичных правил (например, «если вопрос про комиссии — агент обязан свериться с таблицей комиссий»), из которых собираются метрики под конкретный сценарий использования.

Как вы решаете для себя вопрос «делать агента или обойтись скиллом/промптом» — по ощущению или по каким-то конкретным критериям?

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ РТК-ЦОД и «ИТ Школа Ростелекома» представили гибкую инфраструктурную модель для развития цифровой среды вузов Архив рубрики ~Лента новостей~ Предприниматель рассказал, как его данные пытались украсть через ссылку в ответе Claude и вредоносный «навык» для Claude Code Архив рубрики ~Лента новостей~ Увидим ли мы 27 августа 2026 года Марс размером с Луну? Архив рубрики ~Лента новостей~ Apple может добавить Apple Pencil в свой первый складной смартфон, но не стоит ожидать его появления на старте продаж. Архив рубрики ~Полезное~ Полезный лайфхак: любую статью с arXiv можно за секунду превратить… Архив рубрики ~Лента новостей~ Компания Magna увеличивает свои инвестиции в индийский рынок систем замены батарей, приобретя компанию Yuma за 35 миллионов долларов. Архив рубрики ~Лента новостей~ Instagram* обязал авторов маркировать профили с ИИ-персонажами, чтобы их не путали с реальными людьми Архив рубрики ~Лента новостей~ OpenClaw 2.0 уже здесь, открывая эру «многопользовательского» программирования ИИ: что это значит для предприятий. Архив рубрики ~Лента новостей~ Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf Архив рубрики ~Лента новостей~ Искажения: о чём молчат нули Архив рубрики ~Лента новостей~ В августе города расторгают контракты с компанией Flock с рекордной скоростью. Архив рубрики ~Лента новостей~ Экономьте с этими выгодными предложениями на Apple Watch SE 3! Архив рубрики ~Полезное~ Озвучиваем видосы и аудиокниги любыми голосами — вышла нейронка VoiceStudio,… Новости робототехники Лачи Грум поддерживает индийский стартап, цель которого — обеспечить бесперебойную работу самолетов в течение года. Архив рубрики ~Лента новостей~ РТК-ЦОД и «ИТ Школа Ростелекома» представили гибкую инфраструктурную модель для развития цифровой среды вузов Архив рубрики ~Лента новостей~ Предприниматель рассказал, как его данные пытались украсть через ссылку в ответе Claude и вредоносный «навык» для Claude Code Архив рубрики ~Лента новостей~ Увидим ли мы 27 августа 2026 года Марс размером с Луну? Архив рубрики ~Лента новостей~ Apple может добавить Apple Pencil в свой первый складной смартфон, но не стоит ожидать его появления на старте продаж. Архив рубрики ~Полезное~ Полезный лайфхак: любую статью с arXiv можно за секунду превратить… Архив рубрики ~Лента новостей~ Компания Magna увеличивает свои инвестиции в индийский рынок систем замены батарей, приобретя компанию Yuma за 35 миллионов долларов. Архив рубрики ~Лента новостей~ Instagram* обязал авторов маркировать профили с ИИ-персонажами, чтобы их не путали с реальными людьми Архив рубрики ~Лента новостей~ OpenClaw 2.0 уже здесь, открывая эру «многопользовательского» программирования ИИ: что это значит для предприятий. Архив рубрики ~Лента новостей~ Букмарклет вычисляющий скорость gguf модели в llama.cpp на hf Архив рубрики ~Лента новостей~ Искажения: о чём молчат нули Архив рубрики ~Лента новостей~ В августе города расторгают контракты с компанией Flock с рекордной скоростью. Архив рубрики ~Лента новостей~ Экономьте с этими выгодными предложениями на Apple Watch SE 3! Архив рубрики ~Полезное~ Озвучиваем видосы и аудиокниги любыми голосами — вышла нейронка VoiceStudio,… Новости робототехники Лачи Грум поддерживает индийский стартап, цель которого — обеспечить бесперебойную работу самолетов в течение года.

Оставить комментарий