О канале InhumanScience
AI about AI by Andrew Kaznacheev
Основные метрики
Вовлечённость
Здоровье аудитории
Часовая активность
МСККогда канал публикует — распределение постов по часам суток.
Последние публикации канала «InhumanScience»
- 2 просмотров, 19 июл. 2026 г.
Apple ML представила VICIS — новый подход к визуальному мышлению для AI-моделей. Проблема: современные vision-language модели умеют следовать текстовым инструкциям, но не умеют "думать визуально". Покажи им набор картинок с общей концепцией — они не поймут, что их объединяет. VICIS (Visual Concept Inference from Sets) — это новая задача и архитектура: модель получает несколько примеров изображений с общей идеей и новый запрос, а затем должна сгенерировать изображения, сохраняющие эту концепцию. Тесты на ImageNet и WordNet показали, что модель лучше обобщает даже на незнакомые концепции и…
Открыть пост в MAX - 2 просмотров, 19 июл. 2026 г.
Apple ML опубликовала исследование об «умном» удалении данных из обученных моделей. Суть: когда пользователь требует удалить свои данные из модели (right to be forgotten), обычно алгоритм обрабатывает все точки одинаково — это дорого. Исследователи задались вопросом: а нужно ли вообще удалять данные, которые почти не повлияли на обучение модели? Через анализ функций влияния (influence functions) на задачах зрения и языка они нашли подмножества данных с пренебрежимо малым эффектом на выходы модели. Если исключить такие точки до запуска процедуры unlearning — вычислительные затраты падают до…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
Apple ML опубликовала исследование о простом способе улучшить генерацию кода у языковых моделей. Метод называется Simple Self-Distillation (SSD): модель сама генерирует решения задач с определёнными настройками температуры, а затем дообучается на этих же примерах через стандартный supervised fine-tuning. Никаких учителей, верификаторов или reinforcement learning. Результат впечатляет: Qwen3-30B-Instruct вырос с 42.4% до 55.3% на бенчмарке LiveCodeBench v6. Особенно заметный прирост — на сложных задачах. Метод работает на моделях Qwen и Llama размером 4B, 8B и 30B. Почему это работает?…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
Nvidia Tech — ускорение криптографии в CUDA 13.3 В CUDA 13.3 появилась новая аппаратная инструкция clmad — беспереносное умножение (carryless multiplication) для всех GPU на архитектуре Ampere и новее. До этого NVIDIA-видеокарты не имели нативной поддержки этой операции, хотя в процессорах x86 она есть уже 15 лет. Что это даёт на практике: — Алгоритм GHASH (основа шифрования AES-GCM, которое используется в TLS и VPN) ускоряется до 18,8x на B200, достигая ~6,3 ТБ/с — Протокол sum-check для zero-knowledge доказательств быстрее в 4–13 раз — Также ускоряются коды Рида-Соломона, CRC, квантовые…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
Google DeepMind представила AlphaGenome — новую AI-модель для анализа генома человека. Инструмент помогает учёным лучше понимать, как устроена ДНК и как работают гены. По сути, AlphaGenome анализирует геномные последовательности и предсказывает, как изменения в ДНК влияют на работу клеток. Почему это важно? Расшифровка генома — ключ к пониманию болезней, создания новых лекарств и разработки методов лечения генетических заболеваний. До сих пор это требовало огромных ресурсов и времени. Это часть более широкой стратегии DeepMind по биоустойчивости — направления, где AI помогает человечеству…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
Робот, который не просто думает словами, но и «воображает» картинку будущего Классическая проблема embodied AI: языковые модели умеют рассуждать текстом, а generative world models — рисовать будущие состояния мира. Но по отдельности ни те ни другие не дают полного плана действий для робота. RxBrain объединяет оба режима в одной модели: на каждом шаге планирования она генерирует и текстовое описание действия, и картинку того, как мир должен выглядеть после этого шага. Архитектура — Mixture-of-Transformers с отдельными FFN для понимания и генерации визуального контента, но с общими…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
UniVR: модель, которая думает картинками, а не словами (by ByteDance) Что если ИИ будет рассуждать не в текстовом пространстве, а прямо в визуальном — как человек, мысленно прокручивающий сценарий в голове? Авторы предлагают UniVR: unified-модель на базе Emu3.5, которая генерирует визуальные цепочки рассуждений (последовательности кадров) без текстовых подсказок. Ключевая идея — RL-алгоритм VR-GRPO с двухуровневой наградой: глобальная оценка завершённости задачи + пошаговая Step-Focal reward, которая прицельно бьёт по ошибочным шагам (логические разрывы, физические несоответствия). Результат:…
Открыть пост в MAX - 2 просмотров, 18 июл. 2026 г.
RL на 2M+ токенах с фиксированным бюджетом GPU — это возможно? Обычно длинный контекст при RL-обучении требует огромного числа GPU: Ring Attention на 32 A100, ByteScale на 1024 GPU. LongStraw предлагает другой путь — не масштабировать железо, а умнее использовать фиксированный бюджет. Ключевая идея: промпт вычисляется один раз без autograd, его состояние сохраняется, а ответы прогоняются последовательно по одному с накоплением градиентов. Это убирает необходимость держать граф промпта и все графы ответов в памяти одновременно. Реализовано для двух архитектур: Qwen (гибрид рекуррентных и…
Открыть пост в MAX - 2 просмотров, 17 июл. 2026 г.
Nvidia Tech запускает nanousd-labs — инструмент для быстрой генерации лёгких USD-рантаймов с помощью ИИ-агентов. Раньше разработчикам приходилось адаптировать огромные существующие кодовые базы, даже если нужна была лишь небольшая реализация с конкретными требованиями к памяти или производительности. Теперь ИИ-агенты читают официальную спецификацию USD напрямую, генерируют код и сразу проверяют его на соответствие стандарту. Агенты берут на себя механическую работу: парсинг, композицию сцен, разрешение значений. Разработчики при этом сохраняют контроль над архитектурными решениями. Результат…
Открыть пост в MAX - 2 просмотров, 17 июл. 2026 г.
Nvidia представила BlueField-4 — новое поколение инфраструктурных процессоров для агентного ИИ. Суть в том, что современные агентные системы — это уже не просто запрос к модели. Один запрос запускает десятки вызовов инструментов, обращений к памяти и проверок безопасности. Всё это нагружает CPU и замедляет GPU. BlueField-4 берёт эту работу на себя: выгружает сетевые операции, хранилище, безопасность и управление KV-кэшем с хостового процессора на выделенный чип. Результат — GPU загружены полезной работой, а не ожиданием данных. Ключевые цифры: до 800 Гбит/с сети, 64-ядерный Grace CPU на…
Открыть пост в MAX - 2 просмотров, 17 июл. 2026 г.
Nvidia представила NemoClaw — инструмент для интеграции видеоаналитики с корпоративными системами. Раньше AI мог только анализировать видео. Теперь он умеет действовать: автоматически создавать тикеты в Jira, эскалировать инциденты, формировать отчёты и запускать бизнес-процессы на основе увиденного. Как это работает: NemoClaw объединяет три компонента — видеоанализ (VSS Blueprint), корпоративную базу знаний (RAG Blueprint) и агентную оркестровку. Система сначала уточняет у пользователя, что искать в видео, затем обогащает анализ документами компании и выдаёт структурированный отчёт с…
Открыть пост в MAX - 5 просмотров, 17 июл. 2026 г.
Как 0.58% параметров сохраняют всю мощь RL-обучения? RL-дообучение LLM работает, но плохо поддаётся контролю: модель теряет разнообразие решений и начинает конфликтовать между доменами (математика vs. код vs. инструкции). Авторы из Tsinghua предлагают SAR (Subspace-Aligned Rewiring) — геометрический взгляд на RL-обновления весов. Идея: сингулярные векторы базовой модели — это "атомарные навыки", а RL по сути перекоммутирует связи между ними, не меняя сам базис. Значит, достаточно спроецировать RL-обновление обратно на SVD-многообразие базовой модели. Результат — компактная "матрица…
Открыть пост в MAX - 5 просмотров, 17 июл. 2026 г.
Текст и картинка рождаются вместе: SC-CMJP (by Google) Обычные мультимодальные модели генерируют текст и изображение последовательно — сначала текст, потом картинка. Проблема: ошибки в тексте уже не исправить, когда рисуешь. Google предлагает SC-CMJP — фреймворк, где текст и изображение генерируются параллельно и постоянно корректируют друг друга. Ключевая идея: скорость "раскрытия" токенов одной модальности зависит от уверенности другой через cross-modal attention. Если картинка не уверена в каком-то фрагменте — текст может "передумать" и замаскировать токен обратно. Сэмплер CO2Jump работает…
Открыть пост в MAX - 5 просмотров, 17 июл. 2026 г.
Между pretraining и agent fine-tuning есть дыра — и её можно заполнить (by TIGER-Lab) Когда обучают coding-агентов, берут базовую code LLM и сразу гонят agent-trajectory fine-tuning. Но между pretraining и post-training — структурный зазор: базовая модель не умеет рассуждать в стиле "контекст → действие → наблюдение → продолжение". Авторы заметили: вызов функции — это ровно та же структура! Предвызывный код = история агента, сам вызов = действие, возвращаемое значение = наблюдение, код после = продолжение. Решение: mid-training на function-aware FIM. Вместо случайных span'ов маскируются…
Открыть пост в MAX - 13 просмотров, 1 реакций, 16 июл. 2026 г.
Nvidia Tech обновила DeepStream до версии 9.1 с двумя ключевыми фичами для видеоаналитики. AutoMagicCalib (AMC) автоматически калибрует сеть камер без ручной настройки — раньше нужно было расставлять шахматные доски и прерывать работу. Теперь система сама анализирует видео и вычисляет параметры каждой камеры. Multi-View 3D Tracking (MV3DT) объединяет потоки с нескольких камер в единую 3D-систему координат и присваивает объектам стабильные ID при переходе между зонами видимости. Поддерживаются детекторы PeopleNetTransformer, PeopleNet v2.6.3 и RT-DETR 2D. Версия также включает 13 агентных…
Открыть пост в MAX
Качество и доверие
Эвристические сигналы качества по публичным метрикам (охват, реакции, динамика подписчиков). Это не доказанный фрод и не приговор — лишь поводы присмотреться к каналу.
Реклама и монетизация
Средние показатели последних публикаций. Тип определён по тексту поста — оценочно.
Публикации
Дополнительно
Из 32 пойманных постов в диапазоне ID сообщений отсутствует 3. Пропуски — это удалённые посты ИЛИ медиа-альбомы и служебные сообщения (один альбом = несколько ID). Точную причину по одним ID определить нельзя.