Qwen 3.8 27B на M1 Max: форк Splash досяг 39 токенів/с у короткому тесті
Автор форку Splash повідомив про прискорення Qwen 3.8 27B на M1 Max із 18,9 до 39,1 токена за секунду. Розбираємо умови тесту та затримки під час роботи агента.
На MacBook Pro з M1 Max розробник під ніком paperniuk запустив Qwen 3.8 27B через змінену версію Splash. У публічному звіті він порівняв свої Metal-ядра зі стандартними на тому самому ноутбуці: середня швидкість генерації у п’яти коротких завданнях зросла з 18,9 до 39,1 токена за секунду. Це його вимірювання. Команда Splash поки вказує M3 або новіший чип у вимогах до офіційної версії.
Автор тестував 4-бітний Qwen 3.8 27B на M1 Max із 32 ядрами GPU та 64 ГБ об’єднаної пам’яті. Для кожного запуску він використовував свіжий сервер, температуру 0 і набір із п’яти запитів з обмеженням у 250 токенів відповіді. Тож 39,1 токена за секунду описує генерацію в цьому наборі, а не швидкість будь-якої розмови чи роботи агента.
У дописі на Reddit користувач u/Erp4759 описав ще й 43-хвилинну сесію з coding-агентом opencode. Контекст там зріс із 30 до 89 тисяч токенів. За його даними, медіанна швидкість генерації коливалася від 19,5 до 36,5 токена за секунду залежно від довжини контексту. Після викликів інструментів агент ще чекав на перший токен нової відповіді; приблизно половина загального часу йшла на це очікування. Для роботи з агентом варто вимірювати і цю затримку, а не лише швидкість генерації.
У тому ж дописі u/Erp4759 пояснює, що стандартні ядра Splash використовують обчислення, під які M1 не має потрібної апаратної підтримки. У гілці частину операцій переписано для форматів, із якими чип працює швидше, а також виправлено помилку в механізмі зведення часткових результатів. Код доступний окремо; на момент перевірки він не був частиною офіційних інструкцій зі встановлення.
Показник 39,1 токена за секунду вже не варто читати як обіцянку для кожного M1 Max. У публічному коментарі на LinkedIn Максиміліан Мур пише, що на MacBook з M1 Max і 64 ГБ пам’яті отримав приблизно 17 токенів за секунду. Він не навів запитів чи параметрів запуску, тому це не повторення того самого тесту. Автор гілки також не тестував M2. Якщо запускати форк, порівнювати варто на власних задачах і окремо дивитися на швидкість генерації та затримку після викликів інструментів.