Рассказали про то, как строили Агату и с чем столкнулись
tl;dr: хотели сделать умного ассистента для юриста и развить наш оркестратор, а в итоге пришлось даже OCR обучать с нуля
Стартовая точка по пайплайну (для архива в 1080 страниц): open source стек, суммарное время обработки (OCR и вычленение сущностей) — 131 минута, точность агента при ответах на вопросы по делу — около 40% (даже близко неприемлемо)
Начали улучшать — столкнулись с реальностью. Нормальных OCR на русском нет — либо медленно, либо некачественно, либо данные летят за рубеж. Claude и ChatGPT использовать нельзя по понятным причинам. Открытые модели не тянут нагрузку. Сборка агента из готовых фреймворков в российском контуре — квест со своими боссами на каждом уровне
В итоге построили всё своё: три кастомные OCR-модели, дообученную NLP для разделения документов, LLM на 1.5 млрд параметров для извлечения сущностей, кастомный реранкер и state management для агента
Результат на том же архиве: 7 минут вместо 131, точность агента — 85+% (галлюцинаций — минимум, если агент чего-то не знает, то в большинстве случаев говорит, что не знает)
На рынке мы аналогичного продукта не видим. Есть сильные инструменты в жанре СПС, есть КАД Арбитр, есть legaltech стартапы других профилей (корректировка договоров, LLM дообученная на корпусе НПА с нечетким юзкейсом, и др.), есть зарубежные продукты, которые в российский контур не подходят. Собственный стек, заточенный под юридические документы, работающий на российских серверах — кажется, тут мы одни из первых
Спасибо организаторам из Рунетлекс — отличное мероприятие! Будем рады повторить
#agentic_moment #legal_ai





