Компания Thinking Machines представила модель искусственного интеллекта Inkling Small с открытым исходным кодом, которая по производительности приближается к предшественнику, имея размер примерно в 4 раза меньше.
Карл Франзен
Всего через две недели после того, как компания Thinking Machines выпустила Inkling, свою первую языковую модель искусственного интеллекта с открытым исходным кодом, этот хорошо финансируемый стартап, возглавляемый бывшим техническим директором OpenAI Мирой Мурати, сегодня представил Inkling-Small, практически не жертвуя производительностью — и, более того, новая модель превосходит своего более крупного предшественника по нескольким показателям.
Inkling Small — это многомодальная модель рассуждений с 276 миллиардами параметров, работающая под разрешительной лицензией Apache 2.0, которая по рейтингу в стороннем индексе искусственного интеллекта (Artificial Analysis Intelligence Index) отстает от своего более крупного аналога всего на один пункт, несмотря на то, что оригинальная модель Inkling имела 975 миллиардов параметров (внутренние настройки модели). Она принимает текстовые, графические и аудиоданные, генерирует текст и поддерживает контекстное окно до одного миллиона токенов.
Inkling Small использует 12 миллиардов активных параметров на токен, по сравнению с 41 миллиардом активных параметров в Inkling, при этом сохраняя большую часть возможностей кодирования, логического вывода и многомодальной обработки данных флагманской модели.
Для предприятий привлекательность Inkling-Small заключается не только в его меньшем размере. Дело в том, что разработчики, по-видимому, практически не жертвуют возможностями модели, одновременно снижая вычислительные требования, затраты на вывод результатов и занимаемое ею пространство для развертывания.
Эта модель по-прежнему слишком велика для ноутбука или обычной рабочей станции, но она существенно проще в использовании, чем флагманская модель, которая в 3,5 раза больше, что делает её хорошим вариантом для предприятий, имеющих некоторое количество собственных графических процессоров (GPU).
Компания Thinking Machines выпустила полный набор весов для модели Hugging Face и добавила поддержку тонкой настройки через программный интерфейс (API) для обучения моделей Tinker.
На момент запуска компания предлагает ограниченную по времени скидку в 50%, в результате чего цены на API для стандартной модели Inkling-Small с 64K контекстами составляют 0,58 доллара за миллион токенов предварительного заполнения (входные данные), 1,44 доллара за миллион токенов выборки (выходные данные) и 1,73 доллара за миллион обучающих токенов, а кэшированные запросы предварительного заполнения стоят 0,116 доллара за миллион токенов. Также доступен вариант с 256K контекстами по более высоким ценам.
Практически та же производительность при размере вчетверо меньше.
Компания Artificial Analysis присвоила Инклингу-Смоллу 40 баллов по своему индексу интеллекта, тогда как Инклингу — 41 балл.
Этот результат примечателен тем, что у Inkling-Small в общей сложности 276 миллиардов параметров и 12 миллиардов активных параметров, в то время как у Inkling — 975 миллиардов параметров и 41 миллиард активных параметров.
Компания Artificial Analysis также сообщила, что ни одна модель с открытым весом, соответствующая индексу Инклинга-Смолла или меньшему, не показала более высоких результатов по этому индексу.
Эта модель не просто приближается к суммарному баллу флагманской модели. По результатам нескольких оценок она превосходит Inkling.
Компания Thinking Machines сообщает, что Inkling-Small набирает 80,2% баллов в тесте SWE-bench Verified, по сравнению с 77,6% у Inkling, и 64,7% в тесте Terminal Bench 2.1, по сравнению с 63,8% у более крупной модели. Она также опережает конкурентов в тестах SciCode, Humanity's Last Exam, GPQA Diamond и CritPt.
Преимущества не являются повсеместными. Инклинг сохраняет явное преимущество в фактических знаниях и некоторых задачах, связанных с агентными навыками. Инклинг-Смолл набирает 15,5% в задании τ³-Banking по сравнению с 23,7% у Инклинга, а его показатель AA Omniscience отрицательный, что отражает более слабое фактическое покрытие, хотя сообщаемый уровень галлюцинаций у него несколько ниже.
Для предприятий этот компромисс имеет значение. Inkling-Small может быть привлекателен для систем помощи в кодировании, систем управления использованием инструментов, генерации информации с расширенными возможностями поиска, анализа документов и многомодальных рабочих процессов, но организациям, использующим его для решения важных фактических задач, все равно потребуется поиск, проверка и экспертная оценка.
Как модель 276B использует одновременно только 12 параметров.
Inkling-Small — это разреженная модель «Смешанные эксперты». Согласно карточке модели, опубликованной компанией Thinking Machines, её 42-слойный декодер направляет каждый токен к шести из 256 специализированных экспертов, а также к двум общим экспертам, которые остаются активными для каждого токена.
Такая архитектура помогает объяснить различие между 276 миллиардами общих параметров модели и 12 миллиардами активных параметров. Система сохраняет большой объем обученных данных, но активирует лишь их часть на каждом этапе вывода.
Он также изначально поддерживает мультимодальные вычисления. Изображения, аудио и текст проецируются в общее представление и обрабатываются совместно декодером, а не через совершенно отдельные внешние системы. Thinking Machines указывает в числе своих предполагаемых применений помощников по программированию, агентные приложения, чат-боты, системы RAG и другие мультимодальные приложения.
Компания также поддерживает переменную вычислительную нагрузку, позволяя разработчикам увеличивать или уменьшать время вычислений модели в зависимости от сложности задачи. Это дает инженерным командам прямой способ сбалансировать качество, задержку и стоимость для различных рабочих нагрузок.
К сожалению, небольшой размер не означает, что он работает на ноутбуке.
Несмотря на свое название, Inkling-Small не является моделью потребительского масштаба.
Согласно данным Thinking Machines, для стандартной контрольной точки BF16 требуется не менее 600 ГБ совокупной памяти графического процессора. Компания указывает две поддерживаемые конфигурации: 4 графических процессора NVIDIA B300 или 8 графических процессоров NVIDIA H200.
Квантованный контрольный пункт NVFP4 снижает требования примерно до 180 ГБ совокупной видеопамяти. Компания Thinking Machines заявляет, что эта версия может работать в режиме W4A4 на одной видеокарте NVIDIA B300 или в режиме W4A16 на двух графических процессорах H200.
Это исключает обычные ноутбуки, MacBook, настольные игровые ПК и большинство рабочих станций для разработчиков. Даже хорошо оснащенные локальные системы, как правило, значительно не справляются с требуемым объемом памяти.
На практике целевыми средами развертывания являются корпоративные серверы с графическими процессорами, облачные кластеры и специализированные поставщики услуг вывода данных. Поэтому обозначение «малый» относится к Inkling относительно, а не к более широкой вселенной локальных моделей.
Тем не менее, это сокращение имеет существенное значение. Модель, приближающаяся к производительности Inkling, но требующая значительно меньшего объема памяти, может снизить затраты на хостинг, упростить планирование мощностей и расширить круг организаций, способных самостоятельно размещать ее на своих серверах.
Для компаний, стремящихся контролировать данные, поведение моделей и их тонкую настройку, меньший размер занимаемой памяти может быть важнее, чем погоня за максимально возможным эталонным показателем.
И, конечно же, тот факт, что это проект с открытым исходным кодом, означает, что его, несомненно, быстро квантуют (уменьшат точность, но потребуют меньше вычислительных ресурсов) и, вероятно, объединят с другими моделями, чтобы сделать его еще меньше для потребительского оборудования.
Apache 2.0 — это золотой стандарт для корпоративных моделей открытого исходного кода.
Лицензирование может быть столь же важным, как и контрольные показатели.
Inkling-Small распространяется под лицензией Apache 2.0, одной из наиболее распространенных разрешительных лицензий в индустрии программного обеспечения. Она, как правило, позволяет организациям использовать, модифицировать, дорабатывать, распространять и коммерциализировать модель, в том числе внутри проприетарных продуктов, при условии соблюдения требований лицензии к уведомлениям и указанию авторства.
Это предоставляет предприятиям гораздо большую юридическую гибкость, чем многие пользовательские «открытые» лицензии на ИИ, которые могут включать пороговые значения дохода, обязательства по использованию бренда, ограничения на использование или отдельные условия для крупномасштабного коммерческого внедрения.
Это различие становится все более актуальным, поскольку все больше компаний, занимающихся искусственным интеллектом, публикуют весовые коэффициенты моделей, не используя обычную лицензию с открытым исходным кодом.
Например, китайская компания Moonshot, занимающаяся разработкой искусственного интеллекта, на этой неделе предоставила доступ к весам своей передовой модели Kimi K3 под собственной «открытой» лицензией, которая включает дополнительные коммерческие условия, а не сравнительно простые условия Apache 2.0.
Для юридических, закупочных и платформенных команд это различие может существенно упростить внедрение. Apache 2.0 не устраняет необходимости проверять политику допустимого использования, происхождение данных, нормативные требования или обязательства по обеспечению безопасности. Но он предоставляет организациям более четкую отправную точку для создания внутренних систем, выпуска коммерческих продуктов и поддержки модифицированных версий модели.
Более воспроизводимый конвейер разработки моделей
Проект Inkling-Small также демонстрирует, как быстро компания Thinking Machines превратила свой первый крупный релиз модели в воспроизводимый инженерный процесс.
Исследователь из Thinking Machines Хорас Хе сравнил два запуска в публикации на X:
«Если для выпуска Inkling требовалось участие множества людей, то Inkling-Small получился гораздо более рутинным 😆 Мы просто взяли конвейер, использованный для Inkling, добавили уменьшенную модель, и вуаля — новая модель! Inkling Small значительно выиграл от некоторых незначительных улучшений по сравнению с Inkling, но у нас ещё много потенциала…»
Комментарий свидетельствует о том, что компания больше не рассматривает каждую модель как разовый исследовательский проект. Вместо этого она создает многоразовый конвейер для предварительного обучения, последующего обучения, обучения с подкреплением, оценки и выпуска.
Компания Thinking Machines утверждает, что Inkling-Small выиграл от улучшенного набора данных для предварительного обучения, изменений в алгоритме машинного обучения и использования Inkling в качестве учителя для оптимизации стратегии. Затем команда продолжила обучение с подкреплением на основе агентного кодирования в течение двух недель.
Мира Мурати подчеркнула тот же момент в своем собственном посте, описав Inkling-Small как сравнимого с Inkling, но вчетверо меньшего размера, и отметив, что на Tinker можно сразу же настроить и точно отрегулировать веса.
Как предприятиям и разработчикам ИИ следует относиться к Inkling Small
Компания также распространяет полные контрольные точки BF16 и NVFP4 и поддерживает развертывание с помощью инструментов SGLang, vLLM, TokenSpeed, Unsloth и Hugging Face.
Такое сочетание предоставляет разработчикам несколько вариантов развертывания: использование API, тонкая настройка с помощью Tinker, использование стороннего поставщика услуг вывода или запуск модели на частной инфраструктуре.
Inkling-Small — это не та модель, которую большинство пользователей будут скачивать и запускать локально. Но для предприятий, выбирающих между очень большой флагманской системой и более управляемой системой с открытым исходным кодом, она представляет собой привлекательный компромисс: практически тот же уровень интеллекта, более высокие результаты в ряде задач программирования и логического мышления, более низкая стоимость токенов, меньшие габариты оборудования и лицензия, разрешающая широкое коммерческое развитие.
Более широкий сигнал может быть не менее важным. Компания Thinking Machines демонстрирует, что Inkling не был разовым релизом. Компания уже сокращает семейство своих моделей, совершенствует процесс обучения и движется к такому ритму, при котором многофункциональные системы с открытыми весами могут создаваться, улучшаться и развертываться более регулярно.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
15 ИИ-инструментов, которые экономят время предпринимателю
24.12.2025
Продолжаем ведение рубрики «Просто о сложном»: сегодня обсудим, какими статистическими методами можно проверить наличие или отсутствие взаимосвязи между переменными и как выбрать корректный метод
10.02.2026
Конец бесплатного кремния: как Google AI Studio превратилась из рая для инженеров в симулятор смены аккаунтов
26.05.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
