Веб-версияОткрыть в Telegram
LLingtrain

Lingtrain

@lingtrain · канал · в индексе с 2026-06-26
451подписчиков
94средний охват поста
20.8%ER — охват к подписчикам
3постов за 30 дней
S
Sergei Averkiev
🔺 SONAR в lingtrain-aligner Добавил в наш инструмент для выравнивания текстов пулл от Давида с эмбеддинг-моделью SONAR от Meta. 🔸 Поддерживает 200 языков. Полный список кодов здесь (названия тут). 🔸 На MTEB (см. вкладку bitext mining) она показывает себя лучше замечательной модели LaBSE на 100+ языков. 🔸 Пример выравнивания через python библиотеку lingtrain-aligner можно посмотреть в статье. Если прокинуть код языка из списка, то качество должно дополнительно увеличиться (это нужно только для SONAR'а). По-умолчанию, стоит греческий, с ним нормально работает для известных модели языков. В этой же статье рассказывается как дообучить LaBSE на свой язык с примером для марийского и как потом использовать. aligner.align_db(... model_name="sonar", ..., lang_emb_from="bak_Cyrl", #башкирский lang_emb_to="rus_Cyrl" ) 🔸 В веб-приложении модель тоже можно использовать, надо в конфиге .env указать MODEL="sonar". 👉 lingtrain-aligner | UI | Хабр | SONAR
30 · 4.8K ·
S
Sergei Averkiev
GIF
304668863760109575.mp4 · 831 КБ · нажмите — покажем
Сегодня день рождения Юрия Кнорозова, человека, который в 1950-х годах дешифровал письменность майя. Археолог и майянист Майкл Ко в книге «Разгадка кода майя» пишет, что Кнорозов, работая несколько десятилетий в институте Этнографии, занимал «весьма уютный уголок у окна, в ужасающе тесной комнатушке в конце коридора». «Для меня работа Кнорозова знаменует триумф человеческого духа: упорный и целеустремленный одиночка-ученый смог исключительно силой своего ума проникнуть во внутренний мир чужого народа, который жил тысячу лет назад, да еще в джунглях на другой стороне земного шара»
93 · 7.8K ·
S
Sergei Averkiev
Фотография
нажмите — покажем
#подарки 📚📚📚📚📚📚📚📚 Привез из отпуска несколько прикольных книжек на японском и китайском, так как книжные там очень понравились и ничего не купить в них я не смог. Парочку оставил себе, остальные решил подарить, так что, кто учит язык, — пишите, отправлю (если по России) или передам, если в Москве. 👉 Upd. Книжки розданы.
12 · 4.1K ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Фотография
нажмите — покажем
🔺 Обновление Lingtrain По просьбам учащихся добавил в lingtrain-aligner и Lingtrain Alignment Studio армянский язык. Спасибо Максиму Степанянцу из ВШЭ за помощь! 🔸 Отдельный язык нужен, чтобы текст корректно делился на предложения (при делении по привычным знакам препинания можно выбрать язык General). 🔸 В армянском пунктуация как раз своя, вместо точек используются двоеточия, а признаки вопросительного предложения могут стоять внутри, причем их может быть несколько в разных словах. 🔸 P.S. На каникулах добавил в библиотеку много нового — расчет эмбеддингов по API, хранение их в БД, новый модуль corrector. Никак руки не дойдут описать все это, но скоро сделаю.
22 · 4.9K ·
S
Sergei Averkiev
Фотография
нажмите — покажем
#подарки 📚📚📚📚📚📚📚📚 Друзья, из поездок привез пару прикольных книжек на немецком, хочу вам их раздарить. Книжки в основном из поездки на ACL, есть очень клевая про фальшивые цитаты и про исторические зарисовки. 👉 Кто учит язык, — пишите, передам, если в Москве. // Про японские книжки напишу чуть позже Upd. Рильке забрали, про моря забрали Истории забрали
11 · 4.1K ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Друзья, в ближайшие месяцы активно займусь проектом. Планирую его переработать, сделать сервис публично доступным в интернете, поддержать больше языков. Также хочу добавить дополнительные инструменты, посмотреть в сторону перевода, добавить карточки для языков РФ со ссылками на доступные датасеты и кое-что ещё. Уже начал. Stay tuned.
578 ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
🔺 Фотословарь Друзья, сделал небольшое приложение для помощи в чтении китайских текстов. Так как сам слишком часто лезу в словарь и это очень тормозит, то набросал такую штуку — по фотке страницы книжки делаем OCR маленькой моделью и ищем слова по предподготовленным HSK словарям. Можно добавлять слова в списки или скрывать их, чтобы в следующий раз уже знакомые слова не показывались. Можно добавлять свои слова, особенно помогает с именами. Списки сохраняются, можно возвращаться к ним позднее. Пока без всяких повторений, просто для организации. Работает всё локально (и модели и словари) на CPU, получилось довольно удачно, быстро и можно портировать на телефон, чтобы офлайн работало. Поэтому код тоже выложу, можно будет утащить к себе. Развернул все на Lingtrain, можно пользоваться, распознавать, сохранять списки. Если что-то найдете или чего-то не хватает, то пишите в чатик. 👉 https://lingtrain.ru/blog/fotoslovar-dlya-kitayskogo--1a7379
7 · 300 ·
S
Sergei Averkiev
Ссылка
нажмите — покажем
Выложил новый препринт про перевод с коми-язьвинского на русский: «A Komi-Yazva–Russian Parallel Corpus and Evaluation Protocol for Zero- and Few-Shot LLM Translation» Это важная для меня история не только как исследовательский проект. Я сам наполовину коми-язьвинец, поэтому для меня это еще и попытка сделать так, чтобы у этого языка было чуть больше цифрового присутствия. Что за данные? Собрал, насколько я понимаю, первый параллельный корпус коми-язьвинский - русский: 457 выровненных пар предложений из 74 текстов. Данные небольшие, но для исчезающего языка даже такой корпус ИМХО важен. Это не коми-пермяцкий, а более редкий диалект. Корпус собран на основе лингвистической монографии В. И. Лыткина «Коми-язьвинский диалект», где опубликованы тексты и примеры, записанные во время полевой работы среди коми-язьвинцев в Пермском крае. Из этих материалов были вручную выделены и выровнены пары предложений на коми-язьвинском и русском языках. Большое спасибо Эдуарду за помощь с этим. Корпус доступен на Hugging Face: https://huggingface.co/datasets/pparshakov/komi-yazva-russian-parallel Дальше стало интересно, насколько современные LLM хороши в задаче перевода с коми-язьвинского на русский: - zero-shot, когда модель не получает примеров; - few-shot с 4 релевантными примерами; - few-shot с 8 релевантными примерами. Примеры для few-shot не выбирались случайно, а доставались через retrieval из обучающей части. Оценивал несколькими способами: chrF, BLEU, TER, LLM-as-a-judge. Основные результаты: Few-shot сильно лучше zero-shot - Переход от 0 к 4 примерам почти удваивает BLEU: с 6.44 до 12.84. chrF растет с 19.72 до 31.63, а judge-score - с 1.54 до 2.23. - То есть даже очень маленький корпус может быть полезен не только как датасет для будущего обучения, но и как источник примеров прямо в промпте. Больше примеров не всегда сильно лучше Переход от 4 к 8 примерам дает гораздо меньший прирост: chrF растет с 31.63 до 32.96, BLEU - с 12.84 до 13.15, judge-score - с 2.23 до 2.34.
1 · 305 ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Ещё один проект, над которым работаю последние месяцы — это платформа для языковых курсов на базе нашего Lingtrain портала. Немного рассказывал про это, когда ездил в МарГУ в замечательный город Йошку, как его называют местные. Сделал студию для создания курсов, в ней, собственно, создаются модули с описанием заданий, ответами, теорией, подсказками и т.д. Все раскладывается по json'чикам, чтобы веб и мобильный клиенты могли утащить это к себе и красиво отрисовать. Со студией и приложением пару месяцев точно провозился. На старте, конечно, очень большой объем работы надо сделать, чтобы поднять систему в рабочем состоянии. Дизайн UI это вообще отдельная тема. Я, конечно, поделал его немного за свою карьеру, но каждый раз это очень времязатратное задание. Фронтендеры — святые люди, я считаю. Тут Claude Design выручил, за 5-6 итераций поправок рисует приемлемый дизайн, если в него импортировать рабочий репозиторий. Из него потом можно взять архивчик-автопилот для клод-кода, который почти точно (процентов на 80 с опусом) перенесет его в мобильный. Само приложение, это по сути Duolingo, в курсы которого можно будет подмешивать задания на основе параллельных книг Lingtrain, как публичных так и своих (то есть любых, которые сделаете), с дополнительной теорией, для тех кто любит почитать и новыми упражнениями, которые мы с вами туда добавим. Кроме того, это возможность избавиться от досадного недостатка, что до сих пор нет хороших приложений для изучающих языки России — башкирского, татарского, марийского, якутского, чувашского и всех остальных. Так что, возможно, это тоже исправим. 👉 Кто хочет помочь с разработкой таких курсов для своего языка, можете уже начинать. Обсуждать давайте в этой ветке лингтрейн-чата.
2 · 227 ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
🔺 Начал тестировать нашу читалку под андроид, открыл для себя новый дивный мир отладки мобильных приложений. Что прикольно, клод-код (codex надо проверить) умеет подключаться через adb к телефону, ставить туда отладочную версию и собирать логи, пока ты тыкаешь по экранам. Полечил так пару особо интересных багов. На имеющемся POCO смартфоне для включения режима установки через кабель зачем-то необходимо вставить симку (!), ну вот зачем, учитывая, что телефон esim не поддерживает и ты ещё отдельно включаешь режим разработчика. Если ставить приложение через Expo Go, то при загрузке вылезает полупрозрачный серый экран, который всё блокирует. После пары часов дебага оказалось, что это системный экран экспо почему-то не дорисовывается и что он убирается потрясыванием телефона (а-а-а!). Вылезла куча багов в интерфейсе, которых не было под iOS и это очень напоминает веб-разработку в былые времена, когда всё по разному глючило в разных браузерах. Релиз всё ближе. Для выкладывания приложения в google play нужно добавить пару человек с андроид-телефонами в команду тестирования. 👉 Кто хочет поучаствовать (кто на android), скидывайте email в личку
285 ·
S
Sergei Averkiev
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Фотография
нажмите — покажем
Добавил в нашу читалку татарский и башкирский языки, подготовил на них несколько рассказов. Скачать можно тут — ios , android
95 ·

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем