데이터셋
컬렉션에서 데이터 저장·연결 방식에 맞는 데이터셋을 만들고 스키마와 데이터를 관리합니다. 데이터셋을 만든 뒤에는 상세 화면에서 데이터를 올리거나 연결 상태와 버전 기록을 확인합니다.
데이터셋 하위 유형
D.Hub 데이터셋은 저장 방식에 따라 다음 네 가지 하위 유형(type)으로 나뉩니다. 이 값은 만들 때 직접 고릅니다. 아래 목록에 없는 값은 등록할 수 없습니다.
하위 유형 (type) | 설명 |
|---|---|
delta | 파일 업로드와 파이프라인 적재를 지원하는 버전 관리 테이블입니다. 기본 유형입니다. |
kafka | 실시간 메시지 스트림에서 데이터를 수집합니다. |
rest | 외부 REST API를 데이터 소스로 연결합니다. |
object | 파일이나 객체 스토리지의 객체를 데이터 단위로 등록합니다. |
하위 유형은 생성 후 변경할 수 없습니다. 이전 버전의 table 하위 유형은 폐기되었습니다.
데이터셋 만들기
- 컬렉션 또는 폴더에서 항목 추가 ▾ → 데이터셋을 선택하고 하위 유형을 고릅니다.
- 데이터셋 만들기 창의 기본 정보에서 이름·별칭·설명·태그를 입력합니다. 컬렉션 밖에서 창을 열었다면 저장할 컬렉션도 선택합니다.
- 하위 유형에 맞는 항목을 입력합니다.
delta: 적재 방식에서 빈 테이블 또는 PostgreSQL 변경사항 적재를 선택합니다. PostgreSQL 변경사항을 적재하려면 기존 데이터 연결을 선택하거나 연결 정보를 직접 입력합니다.rest: 하나 이상의 URL을 입력합니다.kafka: 필요하면 토픽을 입력합니다.object: 기본 정보만 입력합니다. 만든 뒤 상세 화면에서 파일을 올립니다.
object이외의 유형에서는 다음을 누르고 스키마를 정의합니다. 테이블에서 컬럼을 추가하거나 JSON을 붙여넣고, CSV 파일에서 스키마를 추론할 수도 있습니다.- 생성을 누릅니다. 기본
field1컬럼을 유지한delta데이터셋은 버튼이 임시 스키마로 생성으로 표시됩니다.
만든 데이터셋은 선택한 컬렉션이나 폴더의 목록과 트리에 나타납니다. 선택한 하위 유형은 창에서 변경할 수 없습니다. 컬렉션이나 폴더에서 창을 연 경우에는 저장 위치도 고정됩니다.
데이터셋 상세 화면
컬렉션 트리에서 데이터셋을 선택하면 오른쪽 상세 화면이 열립니다. 상세 화면에는 다음 탭이 있습니다.
| 순서 | 탭 | 내용 |
|---|---|---|
| 1 | 개요 | 기본 정보를 확인하고 편집합니다. |
| 2 | 스키마 | 컬럼 구조를 확인하고 편집합니다. |
| 3 | 데이터 | 데이터를 조회하고 SQL·시각화·파일 업로드 작업을 실행합니다. |
| 4 | 버전 기록 | 버전을 미리 보거나 복원합니다. |
| 5 | 공유 및 권한 | 사용자·그룹 권한을 관리합니다. |
| 6 | 데이터 접근 정책 | 컬럼·행 수준의 접근 범위를 설정합니다. |
| 7 | 사용처 | 이 데이터셋을 참조하는 엔티티와 관계를 표시합니다. |
개요 탭
데이터셋의 메타데이터를 확인하고 편집 모드에서 일부 필드를 수정합니다.
| 필드 | 설명 | 편집 |
|---|---|---|
| 이름 | 데이터셋의 고유 식별자입니다. | 생성 후 변경할 수 없습니다. |
| 별칭 | 사용자에게 표시할 이름입니다. | 편집하고 AI로 값을 제안받습니다. |
| 유형 | delta·kafka·rest·object 중 하나입니다. | 생성 후 변경할 수 없습니다. |
| 태그 | 검색과 분류에 사용합니다. | 편집하고 AI로 값을 제안받습니다. |
| 설명 | 데이터셋의 용도를 기록합니다. | 편집하고 AI로 값을 제안받습니다. |
| 컬렉션 / ID | 소속 컬렉션과 시스템 ID를 표시합니다. | 복사 버튼으로 ID를 복사합니다. |
| 생성·수정 일시 | 작성자와 생성·수정 시각을 표시합니다. | 편집할 수 없습니다. |
rest 데이터셋은 URL(하나 이상)을, kafka 데이터셋은 토픽 정보를 함께 표시합니다.
스키마 탭
스키마 탭에서 데이터셋의 구조를 확인하고 편집합니다. object 데이터셋에는 스키마 편집 항목이 없습니다.
- 행 기반 컬럼 목록: 컬럼마다 열 이름·별칭·설명·데이터 타입·
NULL허용 여부가 한 행에 표시됩니다. 데이터 타입 앞에는 문자·숫자·시간·불리언 등을 구분하는 아이콘이 표시됩니다. - 데이터 타입 선택: 데이터 타입을 그룹별로 탐색하거나 검색합니다. 각 타입에는 네이티브 이름(
int32등)이 함께 표시됩니다. 네이티브 타입 표시를 켜면 Arrow 타입 이름으로 바뀝니다. - 제약 배지: 각 행에서 NOT NULL / NULL 허용을 배지로 토글합니다.
- 컬럼 순서 변경: 행을 끌거나 방향키로 순서를 바꿉니다.
- 보기 모드: 헤더의 테이블 / JSON 토글로 편집 화면과 원시 JSON 정의를 전환합니다.
- 스키마 편집: 편집 모드에서 열을 추가하고 이름·별칭·설명·타입·NULL 허용을 수정합니다.
rest데이터셋에서는 컬럼별 JSONPath를 지정합니다. 이미 데이터가 적재된 기존 컬럼은 이름·타입·NULL 허용이 잠기고 별칭·설명만 편집됩니다.
데이터셋 스키마에는 기본 키(식별 키)·표시 컬럼 개념이 없어 관련 배지나 지정 메뉴가 나타나지 않습니다. 기본 키와 표시 컬럼은 온톨로지 엔티티·관계 편집기에서만 지정합니다.
새로 만든 데이터셋은 임시 스키마 field1만 가진 상태로 시작합니다. 데이터 탭에서 첫 CSV/Parquet 파일을 업로드하면 파일 컬럼으로 스키마가 초기화됩니다.
데이터 탭
데이터 탭에서 실제로 저장된 데이터를 조회하고 분석합니다.
- 페이지 나눔: 한 페이지에 25행씩 나눠서 봅니다.
- SQL 스크래치 패드: 접을 수 있는 SQL 편집기로 임시 쿼리를 실행합니다. SELECT 쿼리만 허용되며 쿼리에 사용할 수 있는 테이블명은 해당 데이터셋으로 제한됩니다. AI 코드 생성은
⌘I(macOS) /Ctrl+I(Windows)로 엽니다. 쿼리 기록도 표시합니다. - 보기 전환(표 · 지도 · 차트): 위도·경도 컬럼과 유효한 좌표 데이터가 있으면 지도 보기 버튼이 나타납니다. 날짜·시간 컬럼과 수치형 컬럼에 유효한 시계열 데이터가 있으면 차트 보기 버튼이 나타납니다. 표·지도·차트는 버튼으로 전환합니다(지도는 마커·히트맵 모드 지원).
- 새로고침 / 다운로드: 최신 데이터를 다시 불러오거나 CSV로 내려받습니다.
- 파일 업로드:
delta·object데이터셋은 파일 업로드 버튼으로 데이터를 추가합니다. 절차는 기존 데이터셋에 데이터 추가에서 확인합니다.
샘플 데이터 채우기
일반 Delta 데이터셋의 데이터 → 샘플 데이터 채우기에서 현재 스키마에 맞는 행을 자동으로 만듭니다.

이 기능은 object, kafka, rest 데이터셋과 PostgreSQL CDC 수집이 연결된 Delta 데이터셋에는 표시되지 않습니다. 실제 필드가 있는 스키마가 필요하며 임시 field1 스키마에서는 먼저 스키마를 정의하세요가 표시됩니다. 미리보기에는 읽기 권한, 실제 채우기에는 쓰기 권한이 필요합니다.
- 생성할 행 수를 입력합니다. 기본값은 100이며 1~100,000행입니다.
- 쓰기 방식을 선택합니다. 추가는 기존 행을 유지하고 덮어쓰기는 기존 행 전체를 교체합니다.
- 같은 결과를 다시 만들려면 선택 시드를 입력합니다.
- 미리보기로 저장하지 않은 처음 20행을 확인합니다.
- 채우기를 눌러 데이터를 기록합니다.
시드를 비우고 미리보기하면 서버가 만든 시드를 실제 채우기에도 사용하므로 저장 결과가 미리보기와 일치합니다. 키 컬럼이 있는 데이터셋에 추가할 때는 기존 생성 행 수 다음부터 키 값을 이어 갑니다.
확인 창에서 영향을 검토한 뒤 실행합니다. 생성 결과는 새 데이터 버전으로 기록되므로 필요하면 버전 기록에서 이전 데이터를 복구합니다.
버전 기록 탭
버전 기록 탭은 데이터 버전을 먼저 보여 주고 그 아래에 메타데이터 변경 이력을 분리해 둡니다.
데이터 버전에는 데이터를 커밋할 때마다 생성된 스냅샷이 표시됩니다. 각 스냅샷에서 최신 여부와 커밋 시각을 확인합니다.
- 미리보기: 스냅샷을 선택하면 그 시점 데이터의 제한된 샘플(최대 25행)을 봅니다.
- 다운로드: 선택한 스냅샷을 CSV 다운로드 또는 Parquet 다운로드로 내려받습니다.
- 변경 요약: 스냅샷 사이의 행 추가·수정·삭제 요약이 있으면 함께 표시됩니다. 행 단위 요약을 제공하지 않는 데이터셋에는 "행 변경 요약 없음"이 표시됩니다. 이 경우에도 샘플을 조회하고 다운로드합니다.
- 아직 데이터 커밋이 없으면 "아직 데이터 버전이 없습니다" 안내가 나옵니다. 데이터를 업로드하면 첫 스냅샷이 생깁니다.
메타데이터 변경 — 별칭·유형·설명·태그·옵션·스키마 변경을 데이터 내용과 분리해 추적하는 이력입니다.
- 미리보기: 특정 시점의 메타데이터를 펼쳐 봅니다.
- 메타데이터 복원: 메타데이터를 이전 시점으로 되돌립니다. 이는 메타데이터에만 적용되며 테이블 데이터는 롤백되지 않습니다. 권한이 있는 사용자만 사용할 수 있고 복원 전 확인을 거칩니다.
데이터셋은 버전 간 차이 비교를 제공하지 않습니다. 각 버전의 내용은 미리보기에서 확인합니다.
사용처 탭
이 데이터셋을 원본으로 사용하는 온톨로지 엔티티와 관계를 표시하는 탭입니다.

- 엔티티와 관계를 두 섹션으로 나누며 각 항목에 종류·표시 이름·소속 컬렉션을 표시합니다.
- 항목의 열기를 누르면 온톨로지 빌더의 해당 엔티티나 관계로 이동합니다.
- 참조가 없으면 빈 상태 안내와 온톨로지 빌더로 가는 안내가 나타납니다.
온톨로지 정의를 바꾸기 전에 사용처 탭에서 영향 범위를 확인합니다.
파일 업로드
파일 업로드는 신규 생성과 기존 데이터셋에 추가 두 갈래로 나뉩니다.
끌어다 놓거나 빠른 추가로 데이터셋 만들기
CSV·Parquet·JSON·Python·SQL 파일을 컬렉션이나 폴더에 끌어다 놓거나 **항목 추가 → 빠른 추가…**를 선택하면 확장자에 맞는 데이터셋·코드가 만들어집니다. CSV·JSON 헤더를 수정하는 절차는 빠른 추가로 파일 업로드하기에서 확인합니다.
기존 데이터셋에 데이터 추가
데이터 탭의 파일 업로드로 기존 delta·object 데이터셋에 데이터를 더합니다. 업로드 전 파일 업로드 검토 창에 스키마 변경 내용이 표시됩니다.
- 파일 선택: CSV 또는 Parquet 파일을 선택합니다. 테이블 데이터셋은 CSV·Parquet만 허용합니다.
object데이터셋은 스키마 검사 없이 파일을 객체로 저장합니다. - 스키마 영향 검토: 선택한 파일의 스키마를 추론해 현재 데이터셋 스키마와 비교하고 차이를 다음과 같이 나눠 보여줍니다.
- 새 컬럼: 파일에만 있는 컬럼 — 업로드 시 스키마에 추가됩니다(스키마 병합).
- 파일에 없는 컬럼 / 타입 충돌 / 파일 간 충돌: 업로드가 차단됩니다. 파일을 수정하거나 데이터셋 스키마를 먼저 편집해야 합니다.
- 데이터셋 스키마가 비어 있거나 임시(
field1)이면 선택한 파일 컬럼으로 스키마를 초기화합니다.
- 업로드 실행: 검토 결과에 따라 버튼이 스키마 초기화 후 업로드 / 스키마 병합 후 업로드 / 업로드 중 하나로 바뀝니다. 실행하면 데이터가 적재되며 진행 상태는 업로드 진행 패널에서 확인합니다.
이 검토 창에서는 헤더를 편집하거나 AI로 컬럼명을 만들 수 없습니다. 헤더를 보정하려면 빠른 추가로 새 데이터셋을 만듭니다.
데이터셋 이름 규칙
데이터셋의 이름은 시스템 식별자이며 생성 후에는 바꿀 수 없습니다. 다음 형식을 사용합니다.
- 소문자로 시작하고 **소문자·숫자·밑줄(
_)**만 사용합니다. - 최대 63자입니다.
- 분석 엔진 SQL 예약어는 사용할 수 없습니다.
이름을 입력하면 같은 컬렉션에서 이미 사용하는 이름인지 검사합니다. 데이터셋·소스·뷰·온톨로지 엔티티·관계는 이름을 함께 관리하므로 서로 같은 이름을 사용할 수 없습니다. 중복되면 "같은 컬렉션의 데이터셋, 소스, 뷰, 엔티티 또는 관계에서 이미 사용 중입니다."가 표시됩니다. 즉시 검사하지 못한 경우에는 저장할 때 다시 검증합니다.
한글 같은 표시용 이름은 별칭에 입력합니다. 별칭에는 이 제약이 없습니다.
컬럼명 규칙
스키마 컬럼명은 다음 규칙을 지켜야 합니다. 규칙을 위반하면 인라인 오류가 표시됩니다.
- 빈 이름: 컬럼명을 비워 둘 수 없습니다.
- 첫 글자와 허용 문자: 영문자 또는 밑줄(
_)로 시작하고 이후에는 영문자·숫자·밑줄만 사용합니다. 한글·공백·/·\·기타 기호는 허용되지 않습니다. - 예약어: 분석 엔진 SQL 예약어는 컬럼명으로 사용할 수 없습니다.
- 중복 이름: 같은 스키마에서 컬럼명을 중복해 사용할 수 없습니다.
한글 같은 표시용 이름은 컬럼의 별칭에 입력합니다. 별칭에는 이 제약이 없습니다.
지원 데이터 타입
스키마 편집기에서 고를 수 있는 데이터 타입은 다음과 같습니다. 기본 화면에는 Text·Integer 같은 타입 이름이 표시됩니다. 네이티브 타입 표시를 켜면 Arrow 네이티브 타입 이름으로 바뀝니다.
| 타입 이름 | 네이티브(Arrow) | 설명 |
|---|---|---|
Text | utf8 | 문자열 (UTF-8) |
Smallint | int16 | 작은 정수 |
Integer | int32 | 정수 |
Bigint | int64 | 큰 정수 |
Real | float32 | 부동소수점(단정밀도) |
Double | float64 | 부동소수점(배정밀도) |
Numeric | decimal | 고정소수점(정밀도·스케일) |
Boolean | bool | 참/거짓 |
Date | date32 | 날짜 |
Time | time32 | 시간 |
Timestamp | timestamp | 타임스탬프 |
List | list | 동일 타입 요소의 배열 |
Binary | binary | 바이너리 데이터 |
네이티브 타입 표시를 켜면 Date32와 Date64 중 하나를 선택합니다. date32는 일 단위이고 date64는 밀리초 단위입니다.
업로드한 파일의 컬럼 타입은 자동으로 추론됩니다. 위 표는 스키마 편집기에서 직접 선택할 수 있는 타입 목록입니다.
다음 단계
- 컬렉션 코드 — 파이프라인에서 사용할 코드를 준비합니다.
- 컬렉션 버전 기록 — 데이터셋 변경 이력을 확인하고 이전 버전을 복원합니다.
- 컬렉션 항목 추가·이동 — 컬렉션에 데이터셋을 추가합니다.