В интернете кончились данные — разработчики ИИ скупают рабочие чаты и записи созвонов
OpenAI, Anthropic и другие компании ищут новые источники данных для обучения моделей. Особый интерес вызывают письма, Slack-переписки, записи совещаний и история работы с кодом — особенно у стартапов перед продажей или закрытием.
OpenAI, Anthropic и другие компании ищут новые источники данных для обучения моделей. Особый интерес вызывают письма, Slack-переписки, записи совещаний и история работы с кодом — особенно у стартапов перед продажей или закрытием.
The Information сообщает, что спрос растет на фоне того, что доступных общедоступных текстов из интернета становится недостаточно для дальнейшего масштабирования обучения. Компании интересуются не только документами, но и данными о том, как сотрудники взаимодействуют друг с другом: переписками в рабочих мессенджерах, электронной почтой, записями видеозвонков, тикетами и историей изменений программного кода.
Такие данные показывают, как люди решают реальные рабочие задачи: обсуждают финансовые показатели, исправляют ошибки в программах, принимают решения и объясняют коллегам свои действия. Это делает корпоративные архивы особенно ценными для разработчиков ИИ-агентов, которых обучают выполнять многоэтапную работу вместо пользователя.
На фоне спроса растет и рынок посредников. Гендиректор брокера данных Protege Бобби Сэмюэлс рассказал, что объем сделок компании увеличился примерно с $30 миллионов в прошлом году как минимум до $100 миллионов в 2026 году.
Особенно привлекательными становятся данные стартапов, которые готовятся закрыться или перейти к новому владельцу. После подписания соглашения о покупке Warmly компанией HubSpot стартап получил четыре предложения о продаже внутренних данных. Потенциальные покупатели были готовы заплатить до $300 тысяч за материалы, включавшие электронные письма и записи рабочих встреч. Warmly от сделок отказалась.
По мере роста рынка усиливаются и риски для конфиденциальности. Продавцам необходимо удалять из массивов персональные и другие чувствительные данные, не уничтожая при этом информацию о самом ходе работы сотрудников. Компании, занимающиеся подготовкой таких датасетов, утверждают, что используют отдельные процедуры анонимизации.
Релоцировались? Теперь вы можете комментировать без верификации аккаунта.