Potion of Intelligence
Последние несколько дней активно тестирую открытые (open weights) языковые модели ИИ. И это оказался весьма отрезвляющий опыт, спускающий с небес на землю. Для меня разбился один из ключевых мифов, который я почему-то долго принимал на веру.
Возможно, вы слышали (возможно, даже от меня!), что один из трендов в ИИ — повторение результатов меньшими ресурсами. Давайте разберём на примере. В сентябре 2024 вышла первая «думающая» модель o1 от Open AI. Это была самая «умная» модель на рынке, которая всех побила во всех тестах. Нет открытых данных сколько денег ушло на её обучение и на каком железе она работала. Но по грубым оценкам, обучение стоило в районе 100 млн. долларов, а запускается каждая копия флагманских моделей Open AI на стеках из 8-16 GPU «промышленного» уровня, общей стоимостью в районе 200-400 тысяч долларов.
И вот, спустя примерно полгода китайцы делают первую открытую «думающую» модель DeepSeek R1, которая в тестах примерно на уровне o1. По реалистичным оценкам обучение R1 обошлось китайцам минимум в 5 млн. $, а скорее всего ещё больше. Но это всё равно в 5-10 раз дешевле чем у o1 от Open AI. DeepSeek R1 это открытая модель, в теории любой может её скачать и запускать у себя. Беда в том, что «полная» версия (671B параметров, FP16) требует 1.2 терабайта VRAM, поэтому вам потребуется всё тот же стек из 8+ GPU за сотни тысяч $. Но с открытыми моделями дальше начинаются варианты.
Если вас устраивает что модель будет работать очень медленно, вы можете загрузить её в 1.2 ТБ значительно более медленной «объединённой» памяти Apple, купив стек из 3х Mac Studio за ~30к$. 30k$ это всё ещё безумно дорого для простых смертных, но это хотя бы уже не 300k$. Но это только начало.
Дальше начинается так называемая квантизация. Это технология, позволяющая пожертвовать точностью вычислений в 2-4 раза и сбросить требования к памяти в те же 2-4 раза, лишь незначительно потеряв при этом в «интеллекте». В FP4 нужно уже «всего» 300 GB памяти. Но и это все ещё очень далеко от массового пользователя. У меня, например, на далеко не самом слабом ПК, всего 16 GB быстрой VRAM и ещё 96 GB медленной RAM.
А ещё дальше начинается так называемая дистилляция. Берётся какая-нибудь в 10+ раз более маленькая модель, например, Mistral 14B и дообучается на ответах DeepSeek R1. Вы спросите, разве может маленькая модель вобрать в себя знания и умения в 10 раз более большой? И вот мы подходим к сути мифа.
В тестах («бенчмарках») и на некоторых специфичных задачах, «дистиллированные» модели якобы показывают себя почти на уровне в 10+ более объемных флагманов. Да, мол, потери есть, но даже 70% производительности флагмана это уже очень много. Флагманы ведь тоже на месте не стоят. Сегодняшний «дистиллят» на уровне флагмана прошлого поколения. Завтрашние «дистилляты» уже будут на уровне нынешних флагманов. Суть мифа в двух словах: ChatGPT 5.4 Thinking, лучшая модель сегодня, через год будет запускаться на вашем ПК, а через два года на вашем смартфоне!
Так вот, я сполна убедился, что это всё полная туфта. Реальность очень сильно расходится с хайпом. Продолжение будет в следующем посте.
5 · 330 ·