정확도 70%에 멈춘 기업용 생성형 AI, 인포시즈는 왜 "그래프"에서 답을 찾았나

개요

항목 내용
주제 기업 데이터의 파편화와 생성형 AI 환각 문제를 그래프 기술·온톨로지로 해결하는 인포시즈(INFOCZ)의 실전 사례
핵심 관점 "모델을 더 똑똑하게 만드는 것"이 아니라 "데이터의 관계를 먼저 구조화하는 것"이 정확도의 상한을 바꾼다
핵심 키워드 Vector RAG 한계 · 그래프 기술 · 온톨로지 레이어 · OQL/DSL · FDE(Forward Deployed Engineer) · 그래프 기반 이상탐지 · 도면 인식 · 시뮬레이션 에이전트
출처 EO Korea 다큐멘터리 「정확도 70%에 머문 AI, 그래프 기술로 근본부터 해결한다」(24:09, 대표 포함 구성원 6인 인터뷰)

핵심 메시지 3가지

① 정확도 70%의 원인은 모델이 아니라 "흩어진 데이터"다

생성형 AI를 도입한 기업들이 겪는 가장 기본적인 실패는 검색 자체가 안 되는 문제입니다. 원인은 기업 안의 데이터가 흩어져 있거나 파편화되어 제대로 활용되지 못하기 때문입니다. 2024~2025년 크게 유행했던 벡터(Vector RAG) 방식으로도 이 문제는 해결되지 않았고, 환각은 남았고 정확도는 약 70% 선에 머물렀습니다.

② 해법은 "모으고 → 연결하고 → 그 위에서 경로 있게 답하는" 구조다

환각을 없애는 길은 흩어진 데이터를 잘 모으고 연결해서 분석하는 것이고, 그게 바로 그래프 기술입니다. 인포시즈는 여기에 온톨로지 레이어를 중간 단계로 넣어, 복잡한 개념을 단순화·추상화한 뒤 이미 찾아가는 길이 정해진 상태에서 답변을 생성합니다.

③ 기술의 소유권을 지킨 결정이 회사를 만들었다

대기업 대규모 프로젝트 수주 직전, 솔루션 소유권 전체를 넘기라는 요구를 받고 십몇 일을 고민한 끝에 계약을 포기했습니다. 재정적 임팩트는 컸지만, 이 결정이 "자체 기술력을 보유한다"는 인포시즈의 기본 모태가 되었습니다.


1. 문제 진단 — 왜 기업 AI는 검색 한 번 제대로 못 하는가

표면을 깨고 더 깊이 내려간다는 다큐의 도입 메타포 — 'DEEPER'(https://)

단계 상황 결과
① 도입 많은 기업이 생성형 AI를 도입 기대와 다른 현장
② 증상 가장 기본적인 검색 기능조차 안 됨 사내 데이터 활용 불가
③ 원인 데이터가 흩어져 있고 파편화됨 제대로 활용되지 못함
①차 시도 벡터(Vector RAG) 로 유사 문서 검색 24~25년 유행·적용
② 잔존 문제 환각 미해결, 정확도 약 70% 정체 엔터프라이즈 신뢰 수준 미달

"24년에서 25년 사이에 크게 유행을 하고 기업들의 적용을 해왔음에도 불구하고 아직까지도 이런 생성형 AI의 환각에 대한 문제가 해결되지 않고 정확도가 약 70% 정도 선에 머물러 있습니다."

여기서 핵심은 정형/비정형의 비대칭입니다. 정형 데이터는 형태가 정해져 있어 기계가 다루기 유리하지만, 비정형(이메일·메시지·계약서·도면)은 "그 외의 전부"라 다룰 방법이 마땅치 않습니다. 그래서 업계는 보통 관련된 걸 찾아서 넣어주는 방식, 즉 벡터 검색에 의존해 왔습니다.


2. 해법의 구조 — 온톨로지 레이어가 '네비게이션'이 되는 순간

인포시즈의 접근은 벡터 검색에서 한 단계 더 나가는 것입니다.

① 문서들이 다루는 개념·대상을 모두 추출
↓
② 같은 개념을 다루는 여러 문서가 한데 모이게 구성
↓
③ 온톨로지 레이어 = 네비게이션의 길/건물/도로처럼 복잡한 개념을 단순화·추상화
↓
④ 그 위에서 먼저 길을 찾고, 찾아진 경로를 기반으로 답변 생성
↓
⑤ 정확도 상승 + "어떤 경로로 나온 답인가" 보이는 설명가능성 + 운영 용이성

약물·이상반응 데이터셋을 노드와 관계(엣지)로 연결한 그래프 시각화 — DrugEntry, AdverseEvent, ActiveSubstance 등 수백~수만 건 단위의 개념이 관계로 묶인다

이 구조가 실제로 화면에 어떻게 담기는지, 온톨로지 탐색 UI에는 타입(종류) 105종 / 객체 46 · 관계 59 라는 숫자가 그대로 표시되어 있습니다. 개념을 추상화한 결과물이 곧바로 운영 도구가 되는 셈입니다.

정확도를 올리는 역발상: AI의 자유도를 줄인다

"절대로 틀리면 안 된다, 정확도가 100% 나와야 한다"는 고객사 프로젝트에서 내린 결론은 이렇습니다.

판단 내용
관찰 자유도가 많다는 건 실수할 일이 많아진다는 것
결정 AI에 자유도를 덜 주자
도구 DSL(도메인에 특화된 언어)
추가 장치 OQL 중간 계층 — 사람이 이해하기 어려운 복잡한 SQL을 LLM도 이해하기 쉽게 중재
효과 환각률을 거의 제로에 가깝게 낮춤

그리고 이 모든 것의 전제 조건이 하나 있습니다.

"결국 에이전트 성능에 진짜 많이 영향을 주는 게 데이터 퀄리티예요. 데이터 정제를 잘하려면 업무 이해도가 굉장히 좋아야 되거든요. 현업과 엔지니어들이 거의 한 몸처럼 일을 해야 AI한테 잘 전달할 수 있는 형태의 정제를 할 수가 있어요."


3. 실증된 성과 3가지 — 그래프가 "돈과 시간"으로 환산된 지점

성과 ① 도면 인식 — 6개월 미해결을 깬 첫 계약

항목 수치
고객사(S사) 보유 도면 약 3,000장
고객사가 인식을 못 하고 찾던 기간 6개월 이상
인포시즈의 당시 비전 기술 보유 상태 없음(0)
사람 수작업 처리 시간 장당 최소 8시간 이상
자동 인식 처리 시간 5분 이내
난이도 복잡한 도면 연결관계 복원은 학계에서도 풀리지 않은 난제, 거의 최초 상용 수준, 서울대학교 공동연구

당시 인력도 없던 비전 영역을 논문부터 뒤져 만들어냈고, 결과는 이랬습니다.

"전 세계적으로 가장 큰 회사들과 했음에도 불구하고 그래프 기술을 활용하는 기술을 보고 아주 새로운 방법이라고 생각하고 대기업에서 저희를 선택하는 그런 계기가 됐었습니다."

격자 좌표와 라인 식별자(CND-178-165 등)가 촘촘히 얽힌 엔지니어링 공정 흐름도(P&ID) 2장 — 사람이 읽던 도면을 기계가 읽어야 하는 대상

성과 ② 그래프 기반 보안 — "규칙 없음"이 패러다임의 차이

구분 기존 보안 제품 인포시즈 제품
탐지 기준 알려진 공격 패턴을 규칙으로 등록 규칙을 애초에 상정하지 않음
동작 방식 규칙 위반 시 차단·알람 평상시 업무에서 크게 벗어나면 자동 알람
2차 처리 분석가 판단 LLM이 위협 여부 필터링 후 보안 분석가에게 전달
잡을 수 있는 공격 순간 대량 유출형 30일 잠복·소량씩 지속 유출형
실증 — 시총 상위권 반도체 회사에서 아예 잡지 못했던 위협 탐지

"한 시간 동안의 로그를 봐서는 알 수가 없고 장기간에 걸친 로그를 그래프 형태로 인식해야지만 잡을 수 있는 그런 공격 패턴입니다. 그래프 기반 이상 탐지를 대규모 엔터프라이즈에서 적용해서 실증한 사례는 국내에서는 없는 걸로 알고 있고요."

'그래프 기반 보안' 슬라이드의 핵심 한 단어 — 규칙 없음

성과 ③ 시뮬레이션 에이전트 — 손익계산서까지 닿는 AI

S사에는 제품 시뮬레이션 에이전트가 만들어졌습니다. 무엇을 많이 만들고 무엇을 적게 만드는지, 원가는 어떻게 되는지를 시뮬레이션하는 에이전트입니다.

  • 생산량·원가 시뮬레이션 → 영업이익에 기여 → 주가에 영향
  • 공정 데이터가 온톨로지화되어 의미론적으로 연결되면 하나의 큰 시뮬레이션이 가능해집니다.
  • 다음 분기점은 비정형 문서 + 도면을 연결하고 나아가 시뮬레이션까지 가능한 설계 에이전트 — 피지컬 세계에 가장 가까운 프로젝트입니다.

4. 2026 에이전트 시대 — 왜 지금 그래프와 온톨로지인가

시점 에이전트 도입 규모
2026년까지 기업당 10~20개 수준
올 하반기~내년 초 수백 개, 수천 개로 공격적 확대 예상
이후 기업의 거의 모든 업무를 에이전트가 수행하는 시대

문제는 개수가 아니라 관리와 정보 전달입니다. 에이전트가 수백 개가 되면 "어떤 정보가 제대로 전달되는가"가 기업의 핵심 리스크가 됩니다.

영역 현재 상태 필요한 것
비용 온톨로지 구축에 돈 많은 대기업만 접근 구축 과정의 상당 부분 자동화
로봇 전시회 시연 대비 실제 현장 투입 10분의 1도 안 됨 현장에 어떤 일을 해야 하는지 가이드·정보 전달
공통 에이전트·로봇이 제대로 동작 못 함 기업 정보와 구조의 전달·활용·관리 = 그래프와 온톨로지

나무들이 푸른 선으로 연결된 항공 촬영 — "모든 것이 연결될 때 힘이 된다"는 그래프의 시각적 은유

연결의 힘은 영화 아바타의 나비족 비유로 설명됩니다. 본인들의 힘을 최대한 끌어내기 위해 서로를 둘러싼 모든 것과 연결하는 장면 — AI 시대에 주변 모든 것이 네트워크 형태로 연결되는 것이 큰 힘을 발휘하는 전형적 예라는 것이 이 회사의 출발 논리입니다.


5. 비즈니스의 변곡점 — 투자, 그리고 포기한 계약

시점 사건 의미
출발 보안 전문 기업으로 시작 IT에서 난이도 최상위 + 엄청난 빅데이터 영역
전환 "인식하지 못하던 정보들이 연결된다면 새로운 인사이트가 생기지 않을까" 그 답이 그래프 이론·그래프 기술
2025년 넘어 Vector RAG 이후의 대안 기술로 그래프가 세계적으로 부상 문의 급증, 그래프 탐색 요청
올해 국내 최대 대형 투자사로부터 투자 유치 (화면 자막: 인포시즈 130억 투자 유치) 기술 노선의 외부 검증
그 사이 모 대기업 대규모 프로젝트 수주 → 솔루션 소유권 전체 양도 요구 → 십몇 일 고민 → 계약 포기 재정적 타격, 그러나 자체 기술력 보유가 회사의 모태가 됨

"한 번은 프로젝트 비용을 받기 때문에 좋지만, 우리 기술 자체에 대한 축적을 찾기가 굉장히 어렵다라는 생각에서 그 프로젝트를 포기하게 됐습니다."


6. 관점 포인트 — 실무자가 짚어야 할 6가지

  1. 정확도는 모델 문제가 아니라 데이터 구조 문제다. 검색이 안 되는 원인을 프롬프트에서 찾으면 70%에서 멈춥니다.
  2. 벡터 RAG는 "관련된 걸 찾아 넣어주는" 단계다. 그 다음 단계는 개념과 대상을 추출해 문서끼리 묶는 일입니다.
  3. AI의 자유도를 줄여라. DSL·OQL처럼 도메인 특화 언어로 선택지를 좁히는 것이 정확도에 직결됩니다.
  4. 경로가 보이는 답변만 운영할 수 있다. 온톨로지의 진짜 가치는 정확도보다 "어떤 경로로 나왔는지" 보이는 설명가능성에 있습니다.
  5. 데이터 퀄리티는 현업 이해도의 함수다. 현업과 엔지니어가 한 몸처럼 붙지 않으면 정제된 데이터가 나오지 않습니다.
  6. 기술 소유권은 협상 항목이 아니다. 소유권 양도 요구를 거절한 결정이 결과적으로 회사의 자산이 되었습니다.

그리고 FDE라는 새 직무

항목 내용
정의 Forward Deployed Engineer(전방 배치 엔지니어) — 고객 문제를 현장에 직접 들어가 해결
업무 범위 문제 발굴부터 전부 직접, 프로젝트 전 현업 워크숍 진행
요구 역량 해당 도메인의 전문가 수준 이해도
수요 증가 이유 대기업은 데이터를 내부에서만 정제해야 하고 외부 유출 불가, 인하우스 인력으로는 해결 불가
작업 속도 솔루션 기반 → 몇 시간 만에 세팅 완료 후 즉시 시연 → 신뢰 확보
보안 전제 다루는 데이터가 산업적·국가적으로 중요 → 보안이 최우선

7. 최종 핵심 정리

확인해야 할 핵심 질문

  • 우리 회사 AI가 검색에 실패하는 이유는 모델인가, 파편화된 데이터인가?
  • 우리는 벡터 검색에 갇혀 있진 않은가? 개념 단위로 문서를 묶는 중간 레이어가 있는가?
  • 답변의 경로를 보여줄 수 있는가? 없다면 운영·개선도 불가능하다.
  • LLM에 불필요하게 넓은 자유도를 주고 있지 않은가? DSL·중간 쿼리 언어로 좁힐 지점은 어디인가?
  • 데이터 정제를 현업 이해도로 하고 있는가, 엔지니어 추측으로 하고 있는가?
  • 에이전트가 수백 개가 되는 시점에 정보 전달·관리 구조를 미리 만들어 둘 것인가?

한 줄 요약: 정확도 70%의 벽은 더 좋은 모델이 아니라, 흩어진 데이터를 그래프로 연결하고 온톨로지로 길을 만든 뒤 AI의 자유도를 줄이는 데서 넘어선다.