Пакетно определяйте и извлекайте таблицы данных из PDF-документов. Загрузите несколько файлов — они начнут конвертироваться автоматически. Каждый результат появляется в списке файлов для индивидуального скачивания, или скачайте всё одним ZIP-архивом. Вся обработка выполняется в вашем браузере.
Автоматически определяйте таблицы данных в ваших PDF-документах с помощью интеллектуальных алгоритмов группировки текста. Определяет структуры столбцов и строк на основе анализа положения текста.
Экспортируйте обнаруженные таблицы в предпочитаемом формате: JSON для обработки данных, Markdown для документации или CSV для приложений для работы с таблицами.
Настраивайте пороги минимальных столбцов и строк для управления чувствительностью определения таблиц. Более низкие значения обнаруживают больше потенциальных таблиц, более высокие — отфильтровывают шум.
Вся обработка выполняется локально в вашем браузере с помощью PDF.js. Ваши PDF-файлы никогда не покидают ваше устройство — без загрузок на серверы, полная конфиденциальность.
Загружать или устанавливать программное обеспечение не нужно. Весь движок извлечения работает в вашем браузере — работает на любом устройстве с современным браузером.
Наш инструмент извлечения таблиц из PDF использует PDF.js для извлечения текста и собственный алгоритм определения таблиц на основе анализа положения текста. Он группирует текстовые элементы по координатам Y для определения строк, а затем анализирует положение столбцов для обнаружения структур таблиц. Несколько PDF можно загрузить и обработать пакетно — они начинают извлекаться автоматически после загрузки. Каждый готовый файл появляется в списке результатов для индивидуального скачивания, или все файлы можно скачать вместе одним ZIP-архивом. Вы можете настроить чувствительность определения с помощью параметров минимальных столбцов и строк. Обнаруженные таблицы можно экспортировать как JSON (структурированный с заголовками и объектами строк), Markdown (форматированные таблицы) или CSV (совместимый с Excel и электронными таблицами). Вся обработка остаётся локальной в вашем браузере — данные никогда не загружаются.
Извлекать таблицы из PDF с помощью нашего инструмента просто:
Перетащите один или несколько PDF-файлов в область загрузки или нажмите, чтобы выбрать файлы на вашем устройстве.
Выберите предпочитаемый формат вывода (JSON, Markdown или CSV). Настройте пороги минимальных столбцов и строк для управления чувствительностью определения таблиц.
Файлы начинают извлекаться автоматически после загрузки. Каждый готовый файл появляется в списке результатов для индивидуального скачивания. Используйте «Скачать всё», чтобы упаковать все файлы в один ZIP-архив.
Этот инструмент определяет таблицы, анализируя положение текста в PDF. Он лучше всего работает с PDF, имеющими чётко структурированные текстовые таблицы. Несколько PDF можно загрузить и обработать пакетно — каждый готовый файл появляется в списке результатов для индивидуального скачивания, или скачайте всё одним ZIP-архивом. Отсканированные PDF (документы на основе изображений) не могут быть обработаны, так как в них нет выделяемого текста. Сложные макеты таблиц с объединёнными ячейками, нерегулярными интервалами или без границ могут определяться не идеально. Настройте параметры минимальных столбцов и строк, если таблицы не определяются или захватывается слишком много шума.