자연어로 데이터 전 과정 설계…AI 에이전트 부상
핵심 요약
자연어 지시로 데이터 수집·정제·질의·분석을 자동화하는 에이전틱 데이터 스택이 제시됐다. LLM과 데이터베이스를 결합해 SQL 변환, 특징공학, 멀티모달 전처리와 작업 오케스트레이션을 수행한다. AgentScope는 데이터 전 과정을 자율적으로 연결해 기업의 분석과 의사결정을 지원하도록 설계됐다.
징런 저우 알리바바 수석부사장 겸 최고AI아키텍트는 12일 제주에서 열린 ACM KDD 2026 기조강연에서 데이터 수집부터 정제, 질의, 분석까지 AI가 연결해 수행하는 ‘에이전틱 데이터 스택’을 제시했다. 사람이 원하는 조건과 결과를 자연어로 설명하면 AI 에이전트가 필요한 처리 절차와 작업 순서를 구성해 실행하는 방식으로, 업무별 데이터 엔지니어링에 수개월이 걸리던 구조를 크게 단축할 수 있다는 구상이다.
적용 대상은 데이터 변환과 스키마 탐색, 텍스트-to-SQL, 특징공학 등 전문인력의 반복 작업 비중이 높았던 영역이다. 스키마 탐색은 데이터베이스의 표와 항목, 연결 관계를 찾는 과정이며, 텍스트-to-SQL은 일상 언어로 된 질문을 데이터베이스용 명령어로 바꾸는 기술이다. 특징공학까지 자동화 범위에 포함하면 원자료에서 분석에 필요한 변수와 특성을 추출·가공하는 작업에도 LLM과 AI 에이전트를 활용할 수 있다.
텍스트뿐 아니라 이미지와 영상, 음성을 함께 다루는 기반모델이 늘면서 대규모 멀티모달 데이터의 전처리도 핵심 과제로 떠올랐다. 저우는 LLM의 언어·의미 이해 능력을 기존 데이터베이스 기술과 결합해 데이터가 지닌 의미를 반영하는 처리 파이프라인을 구축하는 방향을 설명했다. 여기에 문맥과 기억, 도구, 검증 장치를 결합하면 AI가 도구를 선택하고 중간 결과를 점검하며 여러 단계의 추론과 실행을 이어가는 오케스트레이션이 가능해진다.
구현 사례로 소개된 알리바바의 ‘AgentScope’는 데이터 수집과 선별·정제, 데이터베이스 질의, 결과 분석을 자율적으로 수행하도록 설계됐으며 기업의 비즈니스 인텔리전스와 의사결정을 지원하는 용도로 제시됐다. Qwen과 Wan 시리즈를 비롯한 알리바바의 주요 기반모델 개발을 이끄는 저우는 클라우드와 전자상거래 AI 인프라, 빅데이터·데이터베이스 연구개발 경력도 갖고 있다. 이번 논의는 AI 경쟁이 모델 성능을 넘어 보유 데이터를 스스로 찾아 처리하는 역량으로 확장되고 있음을 드러냈다.