Поиск по статьям

Языковые модели. Локально. Без мам, пап и кредитов. Продолжение.

Пишу про опенсорсные языковые модели, которые можно запустить локально и радоваться.

Первая часть вышла почти полгода назад, а за это время в мире опенсорсных языковых моделей (ака LLM) случилось много чего, так что приготовьте вкусняшки и будьте готовы к погружению. Начинаем!!!

Первое что хочется отметить, это безусловная победа китайских опенсурсных моделей, им просто нет числа, следите за пальцами: glm, qwen, minimax, deepseek, dola-seed, kimi, ernie, mimo, longcat, hunyuan (как это вообще произносится, а?!??!?!?!?!?!?!).

Image

Причем, размер этих опенсурсных моделей представлен в достаточно широком диапазоне, от порядка 1 миллиарда параметров (например, Qwen3-0.6B, потенциально запустится даже на телефоне) до триллиона параметров (kimi-k2, тут уже понадобится серверное железо). На не китайском рынке опенсурсных моделей хотелось бы отметить гугловскую gemma 4 (представлено несколько моделей данного семейства) и хуановскую (от нвидиа) Nemotron-3-Super. Что самое интересное, это реальный буст качества работы и ответов таких LLM. В качестве примера приведу задачу, которую удалось решить в VS Code через расширение Kilo Code с использованием Nemotron-3-Super (пока предоставляется бесплатно) в агентском режиме. Мне надо было реализовать регистрацию и авторизацию пользователя, при этом для подтверждения почты на нее отправлялся шестизначный код. Задача была полностью решена (добавлены новые поля в БД, настроено взаимодейтсвие фронтенда и бэкенда, настроена почтовая рассылка и т.д., то есть задача не на 5 минут), от меня требовалось только подробно описать (так как что-то похожее я уже реализовывал, но в другом проекте и на другом языке программирования), что именно я хочу сделать.

Теперь давайте поговорим о железе, для запуска опенсурсных LLM. При прочих равных, чем больше модель (больше параметров), тем она умнее, тем больше оперативной памяти (графической в том числе) она требует для своей работы. И тут на помощь приходят неттопы на Ryzen AI Max+ 395 c 128 гигабайтами (рили) оперативной памяти (да-да, именно обычной DDR).

Image

На таких неттопах можно запускать LLM объемом до 200 миллиардов параметров (зависит от квантования и других факторов, но плюс минус граница определена верно) с скоростью генерации примерно от 15 до 20 токенов в секунду, что более чем приемлемо, я считаю. Для визуализации скорости гляньте этот сервис. Казалось бы, полный фарш, правда ага?

Image

Бам н***й!!!!!

Image

И у всех неттопов примерно такая же стоимость. Причем, когда такие неттопы только пявились, стоимость была в диапазоне от 1500 до 2000 бакинских. Но!!!!!! Даже в этом случае экономика может сходится. Давайте возьмем клодовский тариф в 100 бакинских в месяц (многие пишут, что именно на этом тарифе не упираются в лимиты) и умножим на команду из 5 человек, в год получаем 6000 бакинских. Почему я взял в учет команду? Потому что в многих приложениях, которые поддерживаю локальный запуск языковых моделей есть такая штука как concurrency, то есть одновременный доступ к языковой модели от разных источников (в нашем случае пользователей), что как раз позволяет одновременно работать с языковой моделью нескольким (количество может быть разным) членом команды. При локальном запуске LLM вы вообще забываете, что такое лимиты. На фоне таких новостей, локальные LLM смотрятся очень даже приемлемо.

Никто не спорит, что облачные (закрытые, проприетарные) языковые модели всегда по качеству будут опережать локальные модели (судя по новости выше, данное утверждение дискуссионно), так как, по слухам, уже содержать в себе несколько триллионов параметров. Но!!!! Качество локальных языковых моделей растет с космической скоростью и отстает от топов на шажок или пол шажка (особенно если мы берем все задачи, которые LLM могут решать, а не только кодинг).

А на этом все, пацантре и пацантрины. В продолжении напишу о личном опыте использования языковой модели на телефоне и потенциальных перспективах вообще их локального использования.

Новостной дуйджест. Часть девятая. Вазелиновая.
Новостной дуйджест. Часть десятая. Ворчливая.
Инструменты
Аудит сайта
Автоматический аудит сайта на соблюдение требований законодательства о персональных данных.
Начать проверку