Перенаправление каждой задачи по структурированию данных и извлечению JSON на флагманские модели уровня GPT-4o или Claude 3.5 Sonnet — это неоправданно дорогая операционная ошибка. Стандартные отраслевые бенчмарки обычно смешивают проверку синтаксиса с общими тестами на логику, маскируя реальную способность модели возвращать корректные, детерминированные данные. В реальных пайплайнах сбой валидации схемы ломает интеграцию мгновенно — независимо от размера задействованной нейросети.
Чтобы количественно оценить эту проблему, исследователи представили IFStruct (доступен в LiquidAI/ifstruct-v1.0) — открытый бенчмарк для проверки строгого соблюдения схем. Компактная базовая модель LFM2.5-350M от Liquid AI при локальном тестировании через llama.cpp изначально показала всего 22,6% точности (по сравнению с 21,1% в первом отчете IFStruct). Исторически микромодели плохо справлялись с жесткими синтаксическими ограничениями, если их обучали исключительно классическим методом обучения с учителем (SFT).
Обучение с подкреплением на минимальной инфраструктуре
Целевой подход к постобучению, предложенный Леони Монигатти, Беном Бёртеншоу и Серхио Паньего, доказал: обучение с подкреплением на основе правил устраняет это узкое место без корпоративных бюджетов на вычислительные мощности. Дообучение модели LFM2.5-350M алгоритмом Group Relative Policy Optimization (GRPO) с помощью библиотеки TRL от Hugging Face увеличило точность соблюдения схемы в IFStruct с 22,6% до 29,7%.
Полный цикл обучения требует около 500 примеров и 100 шагов — ресурсов бесплатного GPU в Colab или Kaggle для этого вполне достаточно.
GRPO в связке с детерминированными синтетическими верификаторами превосходит классический SFT: алгоритм поощряет точное следование структуре, а не простое запоминание распределения токенов. Для технических лидеров это меняет экономику архитектуры: тяжелые проприетарные LLM можно оставить для работы со сложным семантическим контекстом на входе, тогда как специализированные микромодели на 350 млн параметров на периферийных устройствах или недорогих стандартных GPU обеспечат форматирование и валидацию JSON с микросекундной задержкой.