HC1 от Taalas: впаянный ИИ меняет рынок GPU — 17000 токенов/с, 20x дешевле

Тема: Революция в AI-инфраструктуре · Специализированные чипы для инференса

Кратко

Стартап Taalas выпустил чип HC1 с жёстко впаянной Llama 3.1 8B, достигающий 17 000 токенов/с при 250 Вт и стоимости в 20 раз меньше GPU-аналога. Технология убирает узкое место памяти HBM, позволяя обновлять модель сменой верхних слоёв металлизации. Ожидается, что к 2030 году цена токена упадёт в 50-200 раз, а рынок разделится на универсальные GPU для обучения и специализированные чипы для инференса.

Главное

  • Taalas HC1: 17k токенов/с, 250 Вт, 20x дешевле GPU, без HBM.
  • Модульность: замена верхних слоёв металлизации позволяет обновлять модель за 2 месяца.
  • Nvidia поглотила Groq за $20 млрд и интегрирует LPU в Vera Rubin.
  • Cerebras IPO на $56 млрд подтверждает спрос на специализированные чипы.
  • Цена токена упадёт до 0.75¢ за миллион, запуская Jevons paradox.
  • ИИ станет вездесущим в устройствах с нулевой задержкой и приватностью.
  • Возникнут «железные классы»: богатые с последними моделями, бедные с устаревшими.

19 февраля 2026 года канадский стартап Taalas вышел из тени и показал то, что многие считали фантастикой: реальный кремний, в котором вся модель Llama 3.1 8B (8 млрд параметров) зашита намертво в верхние металлические слои чипа. Никакой HBM, никакой внешней памяти, никакой CUDA. 17 000 токенов в секунду на одного пользователя. 250 Вт. Воздушное охлаждение. Цена производства — в 20 раз ниже GPU-аналога. Время от готовой модели до кремния — 2 месяца.

Это не демо на симуляторе. Это HC1 — рабочий чип на TSMC N6 (815 мм²), который уже крутит публичный чат на chatjimmy.ai. И это только начало. Taalas обещает: к зиме 2026-го — frontier-модель на HC2, а дальше — «The Model is The Computer». Любой LLM превращается в чистый кремний через их Foundry.

Если план сработает идеально (а вероятность этого 55–65%), текущая модель AI-инфраструктуры трансформируется радикально. Токен станет дешевле, чем электричество. И мир изменится так же кардинально, как после появления iPhone.

Но важно понимать: речь идёт не об «уничтожении» Nvidia, а о появлении нового, огромного сегмента рынка, где специализация побеждает универсальность. Nvidia не исчезнет — она адаптируется, поглощает, гибридизирует. Революция Taalas — это не смерть GPU, а рождение мира, где вычисление раздваивается: универсальное для обучения и исследований, специализированное для инференса в миллиардах устройств.

Часть 1. Тихая революция: почему Taalas — это не просто стартап, а архитектор новой эпохи

Сегодня индустрия ИИ держится на трёх китах:

Taalas выбивает первый кит — универсальность — и показывает, что для подавляющего большинства задач она избыточна. Но при этом не отрицает значение двух других. CUDA остаётся крепостью для обучения. HBM остаётся необходимостью для фронтирных моделей, которые ещё не влезают в специализированный кремний. Революция идёт не по всему фронту — она начинается с самого массового применения ИИ, которое сегодня занимает львиную долю затрат дата-центров: инференса.

Как именно работает «жёсткий» интеллект

Обычный GPU тратит 80–90 % энергии и времени на то, чтобы таскать веса между памятью и ядрами. Taalas убирает эту стену памяти полностью: веса физически выгравированы в металле. Вычисление и хранение — одно и то же. При этом критически важно: только два верхних слоя металлизации меняются под новую модель — остальной чип стандартный. Отсюда и 2 месяца вместо 1,5–2 лет на обычный ASIC. Эта модульность означает, что Taalas может производить «пустые» вычислительные кристаллы заранее, а заказчик выбирает модель для «прошивки» в верхние слои. Обновление чипа без полной замены становится реальностью — как смена картриджа в приставке.

Результат на HC1:

И самое вкусное: LoRA-адаптеры живут в маленьком SRAM-блоке. Можно дообучать под пользователя, не переделывая весь чип.

Почему это меняет текущую модель

Сейчас, чтобы запустить новую версию Llama, вам нужно купить новые GPU или арендовать их в облаке. Taalas предлагает: «Вы хотите Llama-4? Мы сделаем для неё отдельный чип. Он будет работать в 10 раз быстрее и стоить копейки».

Для рынка это означает переход от продажи лопат (универсальных GPU) к продаже штампов (специализированных чипов) — но не полную замену одного другим. Лопаты по-прежнему нужны для копки новых рудников (обучения моделей). Но когда рудник откопан и нужно перемещать тонны породы (инференс), штамп оказывается эффективнее в тысячи раз.

Часть 2. Реакция «старой школы»: консолидация вместо отрицания

В декабре 2025 года, за два месяца до анонса HC1, Nvidia закрыла сделку с Groq стоимостью $20 млрд. Это не прямое поглощение — скорее acqui-hire плюс лицензия на технологию LPU (Language Processing Unit), которую Groq развивал годами. На GTC 2026 в марте Jensen Huang объявил интеграцию Groq LPU в платформу Vera Rubin — новое покорение GPU с блоками для ультра-быстрого инференса. Nvidia назвала 2026 годом «inflection point of inference» — точки перелома для инференса.

Groq при этом остался независимым облачным провайдером, привлёк дополнительное финансирование в $650 млн и продолжает развивать GroqCloud. Бывшие сотрудники Groq работают в Nvidia над гибридными архитектурами. Двойственная картина: с одной стороны, Nvidia усилила позиции в специализированном инференсе; с другой — Groq как независимый игрок сохраняет свою нишу.

Ещё один знаковый сигнал рынка — IPO Cerebras 14 мая 2026 года на Nasdaq с оценкой около $56 млрд. Это крупнейший технологический IPO в США со времён Snowflake (2020). Рынок специализированных AI-чипов валидирован инвесторами на уровне десятков миллиардов. Cerebras (wafer-scale подход) и Taalas (model-specific подход) — разные технологии, но обе получают огромную оценку, подтверждая: специализация — это не эксперимент, а новая норма.

Таким образом, сценарий «схлопывания пузыря» следует скорректировать. Речь идёт не о катастрофе для «старой школы», а о её эволюции через поглощение, интеграцию и сегментацию. Nvidia не умрёт — она станет гибридной. А Taalas откроет рынок, который Nvidia сама не смогла бы обслужить из-за конфликта с собственной бизнес-моделью универсальных GPU.

Хронология трансформации

2026 — Трещина. Taalas выпускает HC1 под Llama 3.1 8B. Первыми клиентами становятся компании с гигантскими объёмами предсказуемого инференса: Amazon для Alexa, Tesla для автопилотов, промышленные конвейеры. Эффект для них: снижение затрат на электричество и оборудование в 5-10 раз. Это не «улучшение», это уничтожение конкурентов, которые останутся на GPU. Одновременно Nvidia интегрирует Groq LPU в Vera Rubin, Meta удваивает закупки GPU (multigenerational deal в тот же день, что и анонс Taalas), показывая: универсальность пока никто не отменяет.

2027–2028 — Расширение. Taalas выпускает HC2 с поддержкой 20B+ параметров. Рынок делится не на два лагеря, а на три: гиганты обучения (Nvidia, AMD) для исследовательских центров; гибридные платформы (Nvidia Vera Rubin с LPU-блоками) для облачных провайдеров; фабрики инференса (Taalas и десятки последователей) для edge-устройств и предсказуемых нагрузок. Аналитики замечают, что рост продаж чистых GPU замедляется, но общий AI-рынок растёт за счёт специализированных чипов. Акции Nvidia не падают катастрофически — они перестраиваются, как акции Intel в эпоху мобильных процессоров.

2029–2030 — Новый порядок. Цена токена падает в 50–200 раз для стандартных задач. Jevons paradox в чистом виде: потребление интеллекта взлетает в тысячи раз. Любой стартап запускает своего агента за копейки. Производительность когнитивного труда растёт на 10–15 % в год. Новый GDP-импульс размером с всю промышленную революцию. Параллельно регуляторы начинают активно интересоваться сделками типа Nvidia-Groq: сенаторы Уоррен и Блюментал требуют от FTC расследования «merger in disguise», что может замедлить дальнейшую консолидацию.

Часть 3. Миф об устаревании: почему «застывший» интелл