미스트랄, 맞춤형 안전 모델로 기업 AI 공략
핵심 요약
미스트랄AI가 기업별 정책을 자연어로 반영하는 멀티모달 안전 모델 실드스트랄을 공개했다. 텍스트와 이미지를 함께 검사하며 16GB 엔비디아 GPU 한 대에서도 구동할 수 있다. 자체 배치가 가능해 오픈 웨이트 모델과 클라우드 안전 서비스 간 경쟁이 확대될 전망이다.
프랑스 인공지능 기업 미스트랄AI가 기업이 자체 정책에 맞춰 유해 콘텐츠 판정 기준을 조정할 수 있는 멀티모달 안전 분류 모델 ‘실드스트랄’을 4일 공개했다. 30억 개 파라미터 규모인 이 모델은 아파치 2.0 라이선스의 오픈 웨이트 방식으로 제공되며, 텍스트와 이미지부터 이용자 프롬프트와 AI 답변까지 검사해 정책 위반 가능성을 확률로 제시한다.
실드스트랄은 안전 기준을 모델 내부에 고정하지 않고 추론할 때 자연어 질문으로 입력받는다. 개인정보 노출 여부나 미성년자에게 적합한 이미지인지를 기업이 직접 물으면 해당 기준에 따라 판정한다. 프롬프트와 답변을 따로 또는 함께 살필 수 있고, AI의 거부 응답이 적절했는지도 평가한다. 한 차례 추론으로 ‘예’와 ‘아니요’의 확률을 산출해 즉시 차단이나 사람의 추가 검토 등 운영 절차에 활용할 수 있다.
개발사가 폭력·혐오·성적 표현 등 분류 체계를 미리 정하는 기존 방식은 새로운 기준을 적용하려면 재학습이나 별도 규칙 엔진이 필요했다. 실드스트랄은 정책 문구를 바꾸는 방식으로 금융·의료·공공·교육 분야의 요구를 반영하도록 설계됐다. 같은 사이버 공격 관련 콘텐츠도 소비자 서비스에서는 막고 보안 연구 도구에서는 허용하는 식의 조정이 가능하다. 16GB 엔비디아 GPU 한 대에서 구동돼 내부 서버나 프라이빗 클라우드에도 배치할 수 있다.
자체 인프라에 모델을 두면 고객 대화와 내부 문서를 외부 검수 서비스로 전송하지 않고 처리할 수 있어 안전 API 비용과 민감정보 전송 부담을 줄일 수 있다. 데이터 처리와 학습, 정렬, 평가는 미스트랄AI의 맞춤형 플랫폼 ‘포지’에서 진행됐다. 구글의 실드젬마 계열, 메타의 라마 가드뿐 아니라 AWS와 마이크로소프트의 클라우드 안전 서비스와도 경쟁이 예상된다. 미스트랄AI는 자체 평가에서 최대 7배 큰 오픈 가드 모델과 대등하거나 높은 성능을 기록했으며 평가 표본은 학습 데이터에서 제외했다고 밝혔다.