Веб-версияОткрыть в Telegram
DData professions - Стартап Нейшн и 12 чеков 🇮🇱

Data professions - Стартап Нейшн и 12 чеков 🇮🇱

@olim_data · группа · Бизнес · в индексе с 2026-05-28
834участников+6 за неделю
12пишущих за 30 дней
45сообщений за 30 дней
13 568сообщений в индексе
L
Просто мусор льётся, которого никогда в жизни не будет.
K
Viacheslav Nefedovберёшь LLM, даёшь ей структуру таблиц и говоришь "напиши мне код для генерации данных на python, используя стандартные функции python для генерации числовых и категорийных данных и faker"
Да так и делаю сейчас, но нужны "адекватные" данные и в итоге это многоитерационный процесс получается. И больше всего времени на допиливание логики генерации
L
Это вопрос, как формализовать ограничения, которые обычно живут в валидаторах
V
всякие компании типа Microsoft выпускают готовые датасеты под некоторые распространённые бизнес-операции
L
Это когда у тебя известный бизнес-домен
V
либо известный формат отчётности - если ты под отчётность генерируешь набор
L
Основная проблема, это внятно запромпьить домен. Если это сделать, можно под него софт сразу создавать
V
если надо сделать демонстрацию на уровне GL - P&L - BS, то можно взять и не совсем из требуемой области. Во многих случаях
V
итеративно запускать, через агента, а не в диалоговой сессии
V
в ERP-системе будет несколько тысяч таблиц, замахаешься заполнять в диалоговом режиме
  1. L
    Вот это основная проблема
Вся ветка · 1 ответ →
L
Когда на демо приходит спец, начинаются странные вопросы, что это у вас.
L
И непонятно как ты её решить, реально
A
Раз такая продуктивная дискуссия - накину актуальное мне, вдруг кто посоветует. Insights automation для sales/marketing funnel (для SaaS). Типа анализировать что сломалось в воронке, в каком разрезе траффик упал или где конверсия сломалась, и давать уже список проблемных мест маркетологам. Делал кто-нибудь тоже что что-то подобное? Есть что-то из подходов, библиотек на примете?
Вся ветка · 1 ответ →
A
Ну такое.. объемы большие, не все выгрузишь, нет системы (подхода к анализу). Я мудрю что-то в сторону построить metric tree, взять список возможных dimensions. Потом раскрывать в нем каждый узел по разрезам максимально объясняющим отклонение. Типа RCA отклонения. У этого подхода есть некоторые минусы на самом деле (может случиться, что важное отклонение будет во вложенном узле, но не в том срезе, который открыл алгоритм).
A
Но вообще не отпускает чувство, что изобретаю велосипед.
  1. V
    почему велосипед? это просто здравый смысл, все так делают
    1. A
      Потому и велосипед, что здравый смысл и многие так должны бы делать ( но почему-то совсем не все так делают), но при этом есть вычислительные нюансы, которые надо заложить в реализацию. Не бином ньютона, но и настолько все тривиально, чтобы написать за 10 минут. Но что-то не нахожу стандартных библиотек, где это было бы автоматизировано.
Вся ветка · 2 ответа →
A
В целом подход рабочий, могу рекомендовать. Много лет успешно использовал в нескольких больших бизнесах. Вопрос именно про автоматизацию.
D
Mikhail AkimovКоллеги, а у кого-нибудь есть такое, что нужно регулярно генерировать разного размера/в разных предметных областях тестовые/демо БД, в которых данные не выглядят очень уж синтетическими?
Когда-то давно, еще в до-AI-ную эру, 😊 мы генерили тестовые данные для Oracle, используя нативную генерацию на основе продакшен данных , через SQL и PL/SQL, что-то типа: INSERT INTO users (user_id, full_name, email, phone, created_at, status, balance) SELECT level AS user_id, -- Случайное Имя + Фамилия из заготовленных списков (CASE TRUNC(DBMS_RANDOM.VALUE(1, 5)) WHEN 1 THEN 'Иван' WHEN 2 THEN 'Анна' WHEN 3 THEN 'Алексей' ELSE 'Мария' END) ' ' (CASE TRUNC(DBMS_RANDOM.VALUE(1, 5)) WHEN 1 THEN 'Иванов' WHEN 2 THEN 'Петров' WHEN 3 THEN 'Сидоров' ELSE 'Смирнова' END) AS full_name, -- Уникальный email на основе GUID или ID 'user_' level '_' LOWER(DBMS_RANDOM.STRING('u', 4)) '@domain.com' AS email, -- Телефон по шаблону +7 (9XX) XXX-XX-XX '+7 (9' LPAD(TRUNC(DBMS_RANDOM.VALUE(10, 99)), 2, '0') ') ' || LPAD(TRUNC(DBMS_RANDOM.VALUE(100, 999)), 3, '0') '-' LPAD(TRUNC(DBMS_RANDOM.VALUE(10, 99)), 2, '0') '-' LPAD(TRUNC(DBMS_RANDOM.VALUE(10, 99)), 2, '0') AS phone, -- Дата за последние 365 дней SYSDATE - DBMS_RANDOM.VALUE(0, 365) AS created_at, -- Статус с распределением вероятностей (80% ACTIVE, 15% INACTIVE, 5% BLOCKED) CASE WHEN DBMS_RANDOM.VALUE(0, 1) < 0.80 THEN 'ACTIVE' WHEN DBMS_RANDOM.VALUE(0, 1) < 0.95 THEN 'INACTIVE' ELSE 'BLOCKED' END AS status, -- Баланс с округлением до 2 знаков ROUND(DBMS_RANDOM.VALUE(0, 50000), 2) AS balance FROM dual CONNECT BY level <= 10000; -- Генерирует 10,000 строк Естественно, это не рекоммендация. Так, понастальгировал 😊
K
Mikhail Akimovа, ну то есть это скорее были стратегии и подходы, не инструменты? интересуюсь, потому что возникла такая задача, с весьма специфическими требованиями: демо данные для BI системы, соответственно данные должны "натурально" выглядеть на графиках, в произвольных разбивках и на детальном уровне (пользо
Чтобы данные адекватно выглядели на разных масштабах я использовал методы фрактальной геометрии. Но это была научная статья и работало все для ценовых рядов. Трейдеры говорили, что графики неотличимы от реальных.

Открытая публичная лента из поискового индекса ChatCrawler — «Google по публичному Telegram»; обновляется по мере обхода площадки. Время — UTC.

Только публичный контент, официальный API Telegram. О проекте · Вопросы · Чего мы не делаем · Убрать страницу из выдачи · Каталог · Поиск · Как мы считаем