20 мс: PDF в Markdown — открытый OCR-инструмент в 300 раз бы
новости
30.08.2026

20 мс: PDF в Markdown — открытый OCR-инструмент в 300 раз быстрее

20 мс: PDF в Markdown — открытый OCR-инструмент в 300 раз быстрее

Разработчики из Firecrawl, проекта, вышедшего из акселератора Y Combinator, представили открытый инструмент OCR It. Это бесплатное браузерное расширение для Chrome и Firefox, которое превращает защищённые от копирования PDF-файлы в аккуратный Markdown. Работает оно, по заявлениям создателей, всего около 20 миллисекунд на документ: вы только нажали кнопку и не успели моргнуть, а чистый текст уже готов. В пересчёте на поток это примерно 200 файлов за три секунды.

Главное преимущество новинки — скорость. Технический директор Firecrawl утверждает, что при сопоставимом качестве распознавания OCR It обгоняет известный инструмент Docling почти в 300 раз. При этом расширение полностью автономно: ему не нужны интернет, API-ключи и даже какие-либо разрешения при установке. Доступ к сайтам запрашивается только в тех случаях, когда требуется автоматически перелистывать страницы или работать с элементами внутри встроенных фреймов.

Пользоваться инструментом просто. Сначала нужно выделить область страницы, которую планируется распознавать, и сохранить её. Затем для каждой страницы достаточно нажать горячую клавишу — расширение само сделает снимок, выполнит OCR и перейдёт к следующему листу. В автоматическом режиме процесс идёт без участия человека: цикл «снимок — распознавание — перелистывание» повторяется до тех пор, пока не встретятся две одинаковые страницы, не случится ошибка или не будет достигнут предел в 300 страниц. Если нужно вмешаться, можно в любой момент нажать Esc. Готовый текст доступен для проверки и правок прямо в панели расширения, после чего его можно скопировать или скачать текстовым файлом.

Однако без недостатков не обошлось. Пользователи уже протестировали OCR It и сходятся во мнении, что он отлично справляется с простыми документами, где текст идёт сплошным потоком. А вот сложная вёрстка — таблицы, формулы, сноски, заголовки, многоколоночные страницы — пока ему не по силам. На таких задачах инструмент может работать нестабильно и допускать ошибки. Тем не менее, для быстрой черновой конвертации PDF в Markdown OCR It выглядит очень перспективно, а разработчики обещают дальнейшие улучшения.

Источник: www.qbitai.com