27 февраля 2026
Фотография
нажмите — покажем
нажмите — покажем
🎯 Martian выпустили крупнейший бенчмарк для оценки AI-агентов, которые проверяют код и он полностью open-source.
Главная проблема большинства AI-тестов - модели со временем просто запоминают ответы. Бенчмарк превращается в «экзамен с известными вопросами», а реальные возможности моделей остаются за кадром.
Martian решили эту проблему архитектурно.
Вместо одного теста они внедрили систему Dual-Layer Evaluation:
- Offline-слой — честное сравнение моделей на статичных данных
- Online-слой — анализ поведения инструментов в реальной работе разработчиков
Если компания попытается «подогнать» модель под офлайн-тест, это сразу станет заметно — её результаты перестанут совпадать с реальным использованием в онлайн-слое.
Фактически это первый самокорректирующийся бенчмарк, который нельзя накрутить маркетингом или обучением на тестовых данных.
Что внутри:
- Более 200 000 реальных изменений кода
- Данные реального поведения разработчиков
- Оценка качества AI-ревью в боевых условиях
- Полная нейтральность — создатели не продают собственные coding-ассистенты
Это первый измеритель качества AI-инструментов для разработки, который не деградирует со временем и отражает реальную пользу, а не лабораторные метрики.
https://codereview.withmartian.com/
5.8K · Max Pastukhovтекст ещё не в индексе
Ну если бы да кабы... мечтать можно много о чем, а факты говорят об обратном.
куча новостей о том, что агенту (даже самому топовому) снесло крышу и он то письма удалил, то бд стер, то еще какую-то дурь сделал. Галюны, лимиты контексты, цены (не дешевые, кстати) - это основные факторы, из-а которых полноценное внедрение довольно проблематично.
Греф уже пытался - 3000 человек уволил вроде. И? НИ-ХУ-Я... потом по тихому этих работяг вернули и попросили исправить косяки после супер-пупер-мега-ии-агентов.
Пока внедрение ИИ - сложно и дорого.
id 1684146975Фотография
приведи пример хотя бы одной РЕАЛЬНОЙ автоматизации, а не 'rag + oai api'. вот тогда можно будет о чем-то большем думать.
id 1684146975🎯 Martian выпустили крупнейший бенчмарк для оценки AI-агентов, которые проверяют код и он полностью open-source.
Главная проблема большинства AI-тестов - модели со временем просто запоминают ответы. Бенчмарк превращается в «экзамен с известными вопросами», а реальные возможности моделей остаются за
Ссылка
нажмите — покажем
нажмите — покажем
Да не первый это тест.
Есть ещё
https://www.prophetarena.co/
Есть ещё с симулированой средой, типа
https://andonlabs.com/evals/vending-bench-2
Фотография
нажмите — покажем
нажмите — покажем
🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация GPT-подобной модели с нуля. Лучший способ понять, как работают LLM внутри.
https://github.com/rasbt/LLMs-from-scratch
3. AI Agents for Beginners
Практика по созданию агентных систем: инструменты, память, планирование, workflow.
https://github.com/microsoft/ai-agents-for-beginners
4. ML for Beginners
Классическая база по машинному обучению: 26 структурированных уроков.
https://github.com/microsoft/ML-For-Beginners
5. OpenAI Cookbook
Официальные примеры работы с API: production-паттерны, RAG, функции, реальные кейсы.
https://github.com/openai/openai-cookbook
6. Python 100 Days
Интенсив по Python с практикой каждый день. Отличная база для входа в AI.
https://github.com/jackfrued/Python-100-Days
7. LLM App Templates
Готовые RAG-шаблоны и production-решения для реальных LLM-приложений.
https://github.com/pathwaycom/llm-app
8. Python Data Science Handbook
Фундамент по NumPy, Pandas, визуализации и классическому ML.
https://github.com/jakevdp/PythonDataScienceHandbook
9. Stable Diffusion
Оригинальный код модели text-to-image - отличная база для изучения генеративного CV.
https://github.com/CompVis/stable-diffusion
10. Segment Anything
Модель от Meta для сегментации изображений - мощный инструмент для компьютерного зрения.
https://github.com/facebookresearch/segment-anything
#AI #MachineLearning #LLM #GitHub #Python #DataScience
7.3K · id 1684146975🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация
Ппц контент, фильтранули, отсортировали и скормили чатгпт
id 1684146975🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация
На скрине 20 строк, в посте 10 ссылок. Бегите, у этого блокбастера будет продолжение..
Alexandr KolesnikovНу если бы да кабы... мечтать можно много о чем, а факты говорят об обратном.
куча новостей о том, что агенту (даже самому топовому) снесло крышу и он то письма удалил, то бд стер, то еще какую-то дурь сделал. Галюны, лимиты контексты, цены (не дешевые, кстати) - это основные факторы, из-а которых
Увольнение 3,000 юристов было в 2017 году, задолго до появления агентского ИИ. Герман Греф, конечно, провидец, но технологий для полной замены еще не было. Сейчас есть. Если конкретнее по тем кейсам которые я слышу от знакомых из разных стран (Россия, Канада, США, Германия) выглядит процесс обычно таким образом: в крупных компаниях организуется ИИ-отдел, в который пылесосом вытягивают лучших и заинтересованных в теме. После чего тихо, без были и шуму постепенно сокращяют остальное. Это касается реально больших компаний, десятки и сотни тысяч людей. Ну и по поводу новостей как где-то агенты чего-то там пролабали. Понятное дело, что технология свежая и "в лоб", без напильника, работать из коробки не будет. Но где есть заинтересованные люди - оно вполне себе работает. И будет набирать обороты, никуда мы от этого не денемся.
Лично я за последние полгода перешел от ручного написания кода к 100% кода писанного агентами. То же касается и работы с данными, аналитики разного вида. Замечу, что еще в июле прошлого года я сам искренне сомневался что хотя бы половину кода буду писать не руками. И на то были основания - начиная от качества агентов и заканчивая ценой вопроса. Сейчас все это сильно прокачалось и подешевело, до момента где основная моя проблема - загрузить работой уже оплаченные мощности.
id 1684146975🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация
репа Python 100 Days кажется на китайском...
Виктор Бородулярепа Python 100 Days кажется на китайском...
Это чтобы Китайский ещё прокачать или модель яндекс перевода
id 1684146975🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация
9. Stable Diffusion - всегда модно и актуально!
28 февраля 2026
Maximтекст ещё не в индексе
Могу я спросить какие вы инструменты использовали для написания и тестирования своей архитектуры, мне очень интересно, может я сам попробую
wavan2012Могу я спросить какие вы инструменты использовали для написания и тестирования своей архитектуры, мне очень интересно, может я сам попробую
Используется Python + numpy, matplotlib, scikit-learn.
Когда буду за компьютером, могу скинуть заготовку для тестов. Там в одном файле всё сразу, все модели и тесты. Но это если только вечером или завтра утром.
id 1684146975🔥 10 GitHub-репозиториев, которые реально прокачают тебя в AI
1. Generative AI for Beginners
Полноценный курс от Microsoft: Jupyter-ноутбуки, практические задания и разработка GenAI-приложений.
https://github.com/microsoft/generative-ai-for-beginners
2. LLMs from Scratch
Пошаговая реализация
Obsidian выкатил версию с cli командами, а тут mcp obsidian c использованием этих команд: https://github.com/Storks/obsidian-mcp
Видео
нажмите — покажем
нажмите — покажем
⚡️Андрей Карпати поделился интересным экспериментом: он попробовал собрать исследовательскую команду из AI-агентов.
В setup:
- 8 агентов (Claude + Codex)
- у каждого свой GPU
- каждый работает как отдельный исследователь
- задачи ведутся через Git-ветки
- коммуникация через файлы
- всё запускается в tmux - как «офис» с окнами
Фактически — попытка построить AI-research-организацию.
Но главный вывод оказался неожиданным.
Агенты:
- плохо продумывают дизайн экспериментов
- делают случайные или бессмысленные вариации
- не строят сильные baseline
- не контролируют compute и время
- часто делают ложные выводы
Пример: агент «обнаружил», что увеличение hidden size улучшает validation loss.
Формально - да. Но модель просто стала больше и дольше обучалась. Никакой научной ценности.
Инсайт:
AI отлично реализует хорошо сформулированные идеи.
Но пока плохо генерирует сильные исследовательские гипотезы.
Теперь мы программируем не модель -
мы программируем организацию.
Source code такой системы:
- промпты
- роли
- процессы
- инструменты
- standup’ы
- workflow
Добро пожаловать в эпоху *Org Engineering*.
https://x.com/karpathy/status/2027521323275325622
6.9K · id 1684146975⚡️Андрей Карпати поделился интересным экспериментом: он попробовал собрать исследовательскую команду из AI-агентов.
В setup:
- 8 агентов (Claude + Codex)
- у каждого свой GPU
- каждый работает как отдельный исследователь
- задачи ведутся через Git-ветки
- коммуникация через файлы
- всё запускается
Сколько газзилионов долларов надо выкинуть в ллмки, чтобы они перестали писать по шаблону "Это не X. Это Y"
id 1684146975⚡️Андрей Карпати поделился интересным экспериментом: он попробовал собрать исследовательскую команду из AI-агентов.
В setup:
- 8 агентов (Claude + Codex)
- у каждого свой GPU
- каждый работает как отдельный исследователь
- задачи ведутся через Git-ветки
- коммуникация через файлы
- всё запускается
Идея классная, но без развития процессов гипотезы разваливаются. Организация главный продукт
Emil Zakirovтекст ещё не в индексе
парсите ast-дерево, затем со своими вершинами и ребрами в граф, затем в neo4j, cypher запросы - как один из множества вариантов
id 1684146975⚡️Андрей Карпати поделился интересным экспериментом: он попробовал собрать исследовательскую команду из AI-агентов.
В setup:
- 8 агентов (Claude + Codex)
- у каждого свой GPU
- каждый работает как отдельный исследователь
- задачи ведутся через Git-ветки
- коммуникация через файлы
- всё запускается
Любопытно почему ыы считаете что "пока". Генерация гипотез — это абдукция, к ней Gen AI совершенно не приспособлен. Это сугубо человеческая функция, творческая.
wavan2012Могу я спросить какие вы инструменты использовали для написания и тестирования своей архитектуры, мне очень интересно, может я сам попробую
Берёшь в руки pytorch и всякую шнягу для красоты и всё.
Торч очень удобен тем, что автодифференцирование написано за тебя
NikitaСколько газзилионов долларов надо выкинуть в ллмки, чтобы они перестали писать по шаблону "Это не X. Это Y"
>это уже не просто Х, это полноценный Y
id 1684146975⚡️Андрей Карпати поделился интересным экспериментом: он попробовал собрать исследовательскую команду из AI-агентов.
В setup:
- 8 агентов (Claude + Codex)
- у каждого свой GPU
- каждый работает как отдельный исследователь
- задачи ведутся через Git-ветки
- коммуникация через файлы
- всё запускается
Инсайт:
AI отлично реализует хорошо сформулированные идеи.
Но пока плохо генерирует сильные исследовательские гипотезы.
Вау, вот это открытие. Достаточно было чат открыть и пообщаться чтобы это понять. Чет Андрей все какие странные эксперименты изобретает