Перейти к основному содержимому

Parquet — колоночный формат со схемой: имена и типы полей уже записаны в файле. В отличие от CSV и Excel, здесь нет строки заголовков, разделителя и кодировки. Если в файле есть вложенные объекты, списки или карты, Fastboard разворачивает их в несколько связанных таблиц — так же, как для JSON и XML. Это удобно, когда данные приходят из аналитических хранилищ и пайплайнов (Spark, Hive и подобные) и нужно быстро завести их в проект без ручной «распаковки» структуры.

Как создать подключение

  1. В конструкторе в правом верхнем углу нажмите иконку базы данных («В диспетчер данных»).

Frame 399.png 2. На странице «Скрипт загрузки» внизу списка подключений нажмите «Создать подключение».

Снимок экрана 2026-08-15 в 03.58.54.png 3. Выберите тип источника «Файл».

Frame 400.png 4. Откроется окно испорта: слева — параметры чтения файла, справа — предпросмотр таблиц. Загрузите ваш parquet файл.

Frame 401.png

Параметры подключения

Название подключения

Имя источника в проекте. Должно быть уникальным в рамках тенанта.

Frame 402.png

Тенанты

К каким тенантам привязан источник. Если тенант один, поле не показывается. Без тенанта создать источник нельзя.

Снимок экрана 2026-08-15 в 04.04.52.png

Расположение файла

  • «Загрузить» — файл с компьютера (действует ограничение размера загрузки, заданное в настройках системы).
  • «С сервера» — файл или папка из хранилища на сервере.
    Снимок экрана 2026-08-15 в 04.06.10.png
к сведению

Если включено «Все файлы в папке», доступен только вариант «С сервера».

Формат файла

Выберите «PARQUET». Режим «Авто» подставит формат по расширению .parquet.

Снимок экрана 2026-08-15 в 04.06.41.png

к сведению

Если включено «Все файлы в папке», «Авто» недоступен: формат нужно указать явно.

Все файлы в папке

Вместо одного файла загружается вся папка. Дополнительно появляются параметры:

  • «Маска» - Фильтр по имени файла. Если не указана, берутся все файлы выбранного формата
  • «Оператор сопоставления» - «Равно», «Не равно», «Содержит», «Не содержит»
  • «Оставлять данные из удалённых файлов» - Включено — строки пропавшего файла остаются в данных; выключено — удаляются вместе с файлом

Снимок экрана 2026-08-15 в 04.08.00.png

Строки предпросмотра

Сколько строк показать справа. От 1 до 1000, по умолчанию 30. На полную загрузку данных не влияет.

Снимок экрана 2026-08-15 в 04.09.37.png

Анализировать весь файл

  • выключено — типы и ошибки определяются по первым строкам (быстрее);
  • включено — по всему файлу (дольше, но точнее, если типы меняются ближе к концу).

Установить тип данных

Снимок экрана 2026-08-15 в 04.10.09.png

  • «По типу первых строк» — система сама определяет число, дату, текст и другие типы;
  • «Для всех строковый» — все колонки как текст. Удобно, если автоопределение ошибается.

Транскрибировать русские символы

Кириллица в именах таблиц и колонок переводится в латиницу (например, ПродажиProdazhi), чтобы имена были корректны для базы. Если выключить — имена остаются как в файле.

Автообновление

Источник сам перечитывается, когда файл или папка на сервере изменились. Для папки учитываются формат и маска.

Сбросить изменения

Возвращает параметры чтения к значениям по умолчанию и заново строит предпросмотр.

Что не настраивается для Parquet

В схеме Parquet уже есть имена колонок, поэтому в окне не показываются или не применяются:

  • «Есть заголовки»;
  • «Загружать с N строки»;
  • «Разделитель»;
  • «Ограничитель» (кавычки);
  • «Кодировка».

Предпросмотр и колонки

Справа видно, как файл превратится в таблицы.

Снимок экрана 2026-08-15 в 04.12.47.png

  • Выбор таблиц — отметьте нужные.
  • Имя таблицы — можно переименовать.
  • «Исключить пустые столбцы» — скрывает колонки без данных.
  • В шапке таблицы можно включить или исключить колонку, переименовать её и сменить тип. Если тип не совпадает с данными, появится ошибка.

После изменения параметров нажмите «Обновить предпросмотр», чтобы перечитать файл.

Даты, сжатие и нюансы загрузки

Даты и время из Parquet сначала приводятся к текстовому виду, а итоговые типы колонок система определяет уже по значениям — как при работе с CSV. Если включено «Для всех строковый», все колонки будут текстовыми.

Поддерживаются распространённые кодеки сжатия: Snappy, Gzip, Zstd, LZ4, Brotli. Если файл сжат другим способом (например, LZO), чтение завершится ошибкой.

Учтите:

  1. Служебные идентификаторы fb_id_system и fb_parent_id_system создаются заново при каждой загрузке. Связь родитель–потомок действует только внутри одной загрузки; повторный импорт даст другие id, поэтому инкрементальное обновление по этим полям не сработает.
  2. Файлы со старым типом timestamp INT96 (часто из Hive, Impala или старого Spark) могут дать сдвиг дат — проверьте значения на предпросмотре.
  3. Если во вложенных группах встречаются одинаковые короткие имена полей, система может взять не ту колонку: по возможности избегайте дублей имён в схеме.

Связанные материалы