ChatCrawlerпоиск по публичному Telegram Открыть приложение
M

Machine learning chat

сообщение · 2026-02-27 07:49 UTC
I
Фотография
нажмите — покажем
🎯 Martian выпустили крупнейший бенчмарк для оценки AI-агентов, которые проверяют код и он полностью open-source. Главная проблема большинства AI-тестов - модели со временем просто запоминают ответы. Бенчмарк превращается в «экзамен с известными вопросами», а реальные возможности моделей остаются за кадром. Martian решили эту проблему архитектурно. Вместо одного теста они внедрили систему Dual-Layer Evaluation: - Offline-слой — честное сравнение моделей на статичных данных - Online-слой — анализ поведения инструментов в реальной работе разработчиков Если компания попытается «подогнать» модель под офлайн-тест, это сразу станет заметно — её результаты перестанут совпадать с реальным использованием в онлайн-слое. Фактически это первый самокорректирующийся бенчмарк, который нельзя накрутить маркетингом или обучением на тестовых данных. Что внутри: - Более 200 000 реальных изменений кода - Данные реального поведения разработчиков - Оценка качества AI-ревью в боевых условиях - Полная нейтральность — создатели не продают собственные coding-ассистенты Это первый измеритель качества AI-инструментов для разработки, который не деградирует со временем и отражает реальную пользу, а не лабораторные метрики. https://codereview.withmartian.com/
5.8K ·

Вся лента · оригинал в Telegram

Открыть в Telegram Каталог площадок Искать в ChatCrawler

Слепок открытой публичной ленты из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог