BNI&C AI Factory
원유와 같은 원문 데이터를 정제하여 다양한 학습 상품으로 가공합니다. 모든 자료에 저작권 라벨과 출처 증명을 함께 담아, 모델이 무엇을 학습했는지 스스로 설명할 수 있도록 돕습니다.
Our Vision
데이터의 출처가
사라지지 않는 산업을
만듭니다.
오늘의 인공지능은 학습의 출처를 설명하기 어렵습니다. 수집 과정에서 기록이 남지 않았기 때문입니다. 저희는 반대 방향에서 출발합니다. 자료 한 건마다 권리를 확인하고, 쓰일 때마다 기록을 남기며, 그 몫을 만든 분께 돌려드립니다.
쌓여 있는 원본 아카이브를 가치 있는 자산으로 바꿉니다. 해석하고, 선별하고, 권리를 확인하는 과정을 거쳐 비로소 상품이 됩니다.
정제된 자료마다 출처 증명을 함께 담습니다. 납품 이후에도, 학습을 마친 뒤에도 출처를 되짚어 보실 수 있습니다.
사용된 만큼 만든 분께 돌아갑니다. 정당한 보상이 이어질 때 좋은 자료의 공급도 함께 이어집니다.
What Is an AI Factory
원유가 정유 공정을 거쳐 LPG와 휘발유, 경유로 나뉘듯 수집된 데이터도 그대로는 학습에 쓰이기 어렵습니다. 해석과 정제, 권리 확인을 거쳐야 비로소 LLM·LMM이 학습할 수 있는 상품이 됩니다.
Product Lineup
제품군에 따라 품질 기준과 모달리티, 출력 형식이 달라집니다. 인출 조건만 조정하시면 동일한 샘플 풀에서 서로 다른 상품을 얻으실 수 있습니다. 어떤 제품이든 모든 행에 출처 증명이 담긴다는 점은 같습니다.
The Problem
오늘의 AI는
근거를 설명하기
어렵습니다.
수집 경로가 남지 않은 코퍼스로 학습하면, 특정 답변이 어느 자료에서 비롯되었는지 확인하기 어렵습니다. 사실 검증과 책임 소재를 가리는 일도 함께 어려워집니다.
저작권 상태가 자료 단위로 정리되어 있지 않으면 모델 배포 시점에 분쟁이 생길 수 있습니다. 이미 학습된 가중치에서 특정 자료만 되돌리기는 현실적으로 어렵습니다.
사용량을 제시할 수 없으면 정당한 대가를 산정할 근거도 마련하기 어렵습니다. 결국 좋은 자료의 공급이 줄어듭니다.
How We Solve It
라이선스를 문서로만 두지 않습니다. 구조화된 필드로 정리해 빌드 파이프라인이 직접 읽습니다. 허용되지 않은 자료는 담당자의 착오가 있더라도 데이터셋에 포함되지 않습니다.
CC 계열 · 공공누리 4유형 · BNI&C 계약 코드
토큰 식별자는 원본의 콘텐츠 해시에서 일정하게 도출됩니다. 같은 자료를 다시 반입하셔도 같은 토큰이므로 이중 계상이 발생하지 않습니다. 해당 자료에서 나온 학습 샘플 전체는 머클 루트로 봉인됩니다.
ERC-721 호환 · 인용 카운터 내장 · 철회 플래그
모델의 응답을 입력하시면 학습 코퍼스에서 근거가 되는 원본을 찾아 파일과 구간, 권리자와 토큰까지 안내합니다. 근거가 확인되지 않으면 그 사실을 함께 표시합니다.
어휘 일치(IDF) + 의미 임베딩 결합
LLM → LMM
| 항목 | 일반 LLM 학습 | BNI&C AI 팩토리 |
|---|---|---|
| 학습 자료 | 웹 크롤 텍스트 위주, 출처 기록 없음 | 영상·음성·이미지·문서 교차 샘플, 자산 ID 유지 |
| 권리 상태 | 사후 대응 (분쟁 발생 후 확인) | 반입 시점 확정, 미확인 자료 자동 격리 |
| 출처 추적 | 확인 어려움 | 샘플 행마다 토큰 ID와 머클 증명 |
| 응답 근거 | 모델의 진술에 의존 | 학습 코퍼스의 원문 구간 제시 |
| 권리자 보상 | 일괄 협상 또는 부재 | 인용 횟수 기반 자동 산출 |
| 철회 대응 | 현실적으로 어려움 | 영향 데이터셋 즉시 산출 후 재빌드 · 통지 |
Business
제품군별로 정제된 데이터를 공급합니다. 구매자께서는 머클 루트로 무결성을 직접 확인하시고, 출처표시 의무는 동봉된 문서로 그대로 이행하실 수 있습니다.
고객사가 보유하신 아카이브를 반입받아 라벨링과 정제, 토큰 발행까지 대행합니다. 데이터의 소유권은 고객사에 남으며, 안심하고 학습에 활용하실 수 있는 상태로 정리해 드립니다.
권리자께서는 보유 자료의 인용 횟수를 확인하시고 그에 비례해 정산받으십니다. 원장이 근거로 남아 정산 과정이 투명합니다.