Оформление
Источники данных
Источник данных — это подключение платформы к вашей базе данных, файлу или объектному хранилищу. Пока источник не подключён, строить датасеты и визуализации не на чем.
Источник принадлежит проекту: он виден только внутри того проекта, в котором создан.
Как подключить источник
- Откройте раздел Источники и нажмите Создать источник.
- Выберите тип источника и нажмите Продолжить.
- Заполните Название — оно должно быть уникальным в пределах проекта. При желании добавьте описание: что за данные, кто отвечает, особенности.
- Укажите параметры подключения — хост, порт, имя базы данных и способ авторизации.
- Нажмите Проверить подключение. Платформа попробует соединиться с базой и покажет результат.
- Сохраните источник кнопкой Сохранить или Сохранить и открыть.

Мастер состоит из трёх шагов, они видны сверху: тип источника → параметры подключения → готово. Вернуться к выбору типа можно ссылкой изменить рядом с названием подключения.
Параметры подключения
Состав полей зависит от типа источника. Для баз данных набор такой:
| Поле | Описание |
|---|---|
| Хост | Адрес сервера базы данных. Платформа обращается к нему со стороны сервера, а не из вашего браузера — адрес должен быть доступен именно серверу |
| Порт | Порт, по которому платформа подключается к базе |
| Имя базы данных | База, к которой выполняется подключение |
| Тип авторизации | «Логин и пароль» либо «Без авторизации» |
| Пользователь, Пароль | Учётные данные. Достаточно прав только на чтение |
| SSL | Шифрование соединения и режим проверки сертификата |
| SSH | Подключение через SSH-туннель, если база недоступна напрямую |
| Initial SQL | Запрос, который выполняется сразу после подключения |
| Кастомные параметры | Дополнительные пары «ключ — значение» для драйвера |
Порт для ClickHouse
Платформа работает с ClickHouse по HTTP, поэтому в поле Порт нужно указать HTTP-порт — по умолчанию 8123. Подставленное в форму значение 9000 — это порт native-протокола, с ним подключение не установится.
Особые поля у Oracle
У Oracle вместо «Имя базы данных» — Service Name (например ORCLPDB1) и переключатель Тип подключения:
| Вариант | Строка подключения |
|---|---|
| Service Name | host:port/service — обычный случай |
| SID | host:port:sid — так подключается, например, Oracle XE |
У остальных типов состав полей одинаковый: хост, порт, имя базы данных и учётные данные.
Шифрование соединения (SSL)
Раскройте секцию SSL и включите Использовать SSL — появится обязательное поле SSL-режим:
| Режим | Что делает |
|---|---|
disable | Без шифрования |
require | Шифрование обязательно, сертификат не проверяется |
verify-ca | Проверяется, что сертификат выдан доверенным центром |
verify-full | Дополнительно проверяется совпадение имени хоста с сертификатом |
Помните, что защищённое соединение обычно слушает другой порт: для ClickHouse это 8443, и платформа прямо подсказывает это под полем.
Где переключатель SSL действует
Секция SSL показывается у любого типа, но настройки доходят до драйвера у девяти: PostgreSQL, Greenplum, Arenadata DB, CockroachDB, MySQL, MariaDB, StarRocks, ClickHouse и ArenaData QuickMarts. Для остальных типов шифрование задаётся в блоке Кастомные параметры — теми ключами, которые понимает драйвер вашей базы.
Отдельный случай — Microsoft SQL Server: платформа явно передаёт ему encrypt=false. Начиная с десятой версии драйвер включает шифрование сам, и без этого значения все подключения к MSSQL внезапно потребовали бы TLS. Нужно шифрование — задайте encrypt=true кастомным параметром, он перекроет значение по умолчанию.
Подключение через SSH-туннель
Если база недоступна напрямую, раскройте секцию SSH и включите Использовать SSH-туннель. Понадобятся адрес и порт промежуточного сервера (по умолчанию 22), имя пользователя и пароль. Платформа поднимет туннель до этого сервера и уже через него пойдёт к базе.
Initial SQL
Запрос, который выполняется при каждом новом соединении с источником, а не однократно. Пригодится, чтобы задать схему по умолчанию или параметры сессии:
sql
SET search_path TO reporting;Кастомные параметры
Дополнительные пары «ключ — значение», которые передаются драйверу подключения. Нужны для нестандартных настроек конкретной СУБД.
Файл
Тип Файл загружает данные напрямую: мастер состоит из шагов «Тип источника → Загрузка файла → Готово».
Поддерживаются CSV, TSV, XLSX, XLS, JSON, PARQUET, AVRO, GZ, ZIP, размер — до 50 МБ. Файл перетаскивается в область загрузки или выбирается кнопкой.
В блоке Разбор файла задаётся, как читать содержимое:
| Параметр | Описание |
|---|---|
| Кодировка | Как декодировать текст. По умолчанию определяется автоматически |
| Разделитель | Символ, разделяющий колонки в текстовых форматах |
| Строка заголовка | Номер строки с названиями колонок; всё, что выше, отбрасывается |

Загруженный файл виден в форме с именем и размером, а нажатие на него позволяет заменить файл, не создавая источник заново.
После сохранения данные файла доступны так же, как таблица базы: платформа определяет колонки и их типы сама. Таблица называется по имени файла без расширения — загруженный regions.csv превращается в таблицу regions с колонками region, manager (строки) и plan, fact (целые числа).

Карточка устроена как у любого источника: слева дерево с единственной таблицей, справа вкладки Данные и Схема, внизу счётчик строк и переключатель лимита.
Когда пригодится «Строка заголовка»
Выгрузки из учётных систем часто начинаются с шапки: название отчёта, период, пустая строка. Укажите номер строки, в которой на самом деле лежат названия колонок, — всё, что выше, платформа отбросит. Иначе первой строкой данных станет заголовок отчёта, а колонки получат имена вида «Отчёт о продажах».
S3
Тип S3 подключает объектное хранилище — Amazon S3 или совместимое, например MinIO.
| Поле | Описание |
|---|---|
| Endpoint | Адрес хранилища, например https://s3.amazonaws.com |
| Регион | Регион бакета, например us-east-1 |
| Бакет | Имя бакета |
| Шаблон путей | Glob-маска объектов внутри бакета, например data/*.parquet |
| Access key, Secret key | Ключи доступа |
| Path-style адресация | Включите для MinIO и других S3-совместимых хранилищ без virtual-hosted адресации |
Ниже — тот же блок Разбор файла, что и у обычного файла. Кнопка Проверить подключение доступна до сохранения.
Как читается шаблон путей
Шаблон — это glob-маска: **/*.csv возьмёт все CSV в бакете на любой глубине, data/2026-*.csv — только файлы за 2026 год в папке data.
Все подошедшие файлы сливаются в одну таблицу: считается, что это части одного набора с одинаковыми колонками. Имя таблицы платформа берёт из неизменяемой части шаблона — последней папки перед маской, а если её нет, то из имени бакета. Например, при шаблоне **/*.csv в бакете datawell-files объект будет называться datawell_files.
Типы колонок определяются автоматически: в проверенном примере текстовые колонки стали VARCHAR, числовые — INTEGER.
Схема читается по первым пяти файлам
Чтобы определить состав колонок, платформа разбирает не весь набор, а несколько первых файлов (по умолчанию пять). Если у шестого файла окажется лишняя колонка, в таблицу она не попадёт — держите файлы набора одинаковыми по структуре.
Новый файл появляется не сразу
Результат разбора кешируется на несколько минут (по умолчанию пять). Если вы только что залили файл в бакет, а в превью его ещё нет — подождите и обновите. Проверено: сразу после загрузки второго CSV источник продолжал отдавать строки только первого.
Если по шаблону не нашлось ни одного файла, платформа честно об этом скажет: «По паттерну не найдено файлов». Слишком большой набор она тоже не возьмёт — на число объектов есть предел.
Просмотр данных источника
Щелчок по названию источника в списке открывает его карточку — можно посмотреть содержимое, не создавая датасет.
- Слева — дерево баз и таблиц с поиском; рядом с базой указано число таблиц.
- Вкладка Данные показывает строки выбранной таблицы. В заголовке каждой колонки виден её тип и признак
NOT NULL. - Вкладка Схема — список колонок с типом, признаком NULL, значением по умолчанию, дополнительными признаками и комментарием из базы.
- Внизу — счётчик показанных строк и переключатель лимита: 100, 1 000 или 10 000. Рядом кнопка обновления, если данные в источнике изменились.

Из карточки же источник редактируется и удаляется — кнопки в правом верхнем углу.
Список источников
В разделе Источники список показывается таблицей или карточками — переключатель справа сверху. Колонка Данные обновлены показывает время последней успешной выгрузки данных в витрину; прочерк означает, что выгрузок не было. По этой колонке нельзя отсортировать — она считается по журналу извлечений. В табличном виде колонки настраиваются кнопкой Колонки, а строки фильтруются по типу источника и владельцу и сортируются щелчком по заголовку. Флажки в первой колонке нужны для действий сразу над несколькими источниками. Внизу — постраничная навигация с выбором размера страницы.
Справочник типов
Всё, что ниже, — для сверки: какие базы поддерживаются, на каком порту их искать и нужно ли администратору догружать драйвер. Для первого подключения это знать необязательно.
В платформе 22 типа источников.
| Категория | Типы |
|---|---|
| Базы данных | Apache Hive, Apache Spark, Arenadata DB, ArenaData QuickMarts, ClickHouse, CockroachDB, Firebird, Greenplum, H2, MariaDB, Microsoft SQL Server, MySQL, Oracle, PostgreSQL, Presto, Red, StarRocks, Trino, Vertica |
| Хранилище | Amazon Redshift |
| Файлы | Файл, S3 |
Почему S3 среди файлов
S3 — объектное хранилище, но платформа работает с ним как с файлами: она не выполняет там SQL, а читает CSV или Parquet по маске и разбирает их тем же способом, что и загруженный файл. Поэтому у S3 и типа «Файл» общий блок Разбор файла. В группе «Хранилище» — аналитические базы вроде Amazon Redshift, к которым уходит обычный SQL-запрос.

Набор доступных типов задаёт администратор в разделе управления типами источников.
Драйверы: что работает сразу, а что нужно догрузить
Часть драйверов входит в поставку, остальные администратор загружает сам: сторонние драйверы намеренно держат вне релиза, чтобы их уязвимости не тянулись в поставку платформы.
| Драйвер в комплекте | Нужно загрузить JAR |
|---|---|
| PostgreSQL, Greenplum, Arenadata DB, CockroachDB | Oracle, Microsoft SQL Server, Vertica |
| MySQL, MariaDB | Firebird, Ред База Данных |
| ClickHouse, ArenaData QuickMarts | Trino, Presto, Apache Hive, Apache Spark |
| H2, StarRocks, Amazon Redshift |
Если драйвера нет, источник создастся и даже сохранится, но при попытке прочитать данные вернётся ошибка вида «Failed to load driver class oracle.jdbc.OracleDriver». Это не проблема доступа к базе — нужно попросить администратора загрузить драйвер, см. Типы источников. После загрузки источник заработает сразу, пересоздавать его не нужно.
Порты по умолчанию
Платформа подставляет порт сама, но подставленное значение стоит проверить: в вашей инсталляции база может слушать другой порт.
| Тип | Порт | Тип | Порт |
|---|---|---|---|
| PostgreSQL, Greenplum, Arenadata DB | 5432 | ClickHouse, ArenaData QuickMarts | 8123 |
| MySQL, MariaDB | 3306 | StarRocks | 9030 |
| Microsoft SQL Server | 1433 | Oracle | 1521 |
| Trino, Presto | 8080 | Apache Hive, Apache Spark | 10000 |
| Firebird, Ред База Данных | 3050 | H2 | 9092 |
| Vertica | 5433 | Amazon Redshift | 5439 |
| CockroachDB | 26257 |
Vertica: 5433, а не 5432
Порт Vertica отличается от порта PostgreSQL всего одной цифрой, и это самая частая опечатка при подключении. Проверено на живой базе: с портом 5433, пользователем и его паролем платформа читает схемы и данные без каких-либо дополнительных настроек — нужен только загруженный драйвер.
Родственные типы
Некоторые типы — это одна и та же база под разными именами: Greenplum, Arenadata DB и CockroachDB подключаются драйвером PostgreSQL, ArenaData QuickMarts — драйвером ClickHouse, StarRocks — драйвером MySQL, Ред База Данных — драйвером Firebird, а Apache Spark — драйвером Hive.
Отечественные сборки подключаются как их основа
Arenadata DB — сборка Greenplum: подключение то же самое, порт по умолчанию 5432, драйвер загружать не нужно. ArenaData QuickMarts — сборка ClickHouse, порт 8123. В справочнике они выделены отдельными типами только ради узнаваемого названия.
Права на чтение
Заводите для платформы отдельную учётную запись с доступом только на чтение и только к тем схемам, которые нужны для анализа. Этого достаточно: платформа не изменяет данные в источнике.
Что дальше
Подключённый источник сам по себе ничего не показывает — на его основе собирается датасет.