리걸 AI 공급업체에 던져야 할 열두 가지 질문, 그리고 경계해야 할 답변
기능 목록은 답하기는 쉽고 검증하기는 어렵습니다. 다음은 우리가 직접 던질 질문들이며, 잘못된 답변이 초래하는 피해의 크기 순으로 정리했습니다. 우리에게 불편한 질문도 함께 담았습니다.
2026년 8월 13일 · Quantum Nexus Ventures FZCO
- legal AI
- procurement
- verification
- AI governance
리걸 AI 선택에 관한 안내는 대부분 그것을 판매하는 쪽이 작성합니다. 그래서 질문이 아니라 기능을 나열하는 데 그치는 경우가 많습니다. 기능은 답하기는 쉽고 검증하기는 어렵습니다. 잘못된 답이 돌아오는 질문은 그 어느 쪽도 아닙니다.
아래는 우리가 실제로 사용할 목록이며, 우리에게도 편안한 목록은 아닙니다. 이 가운데 몇 가지는 1년 전이라면 우리도 제대로 답하지 못했을 질문이고, 그중 하나는 우리 시스템에서 발견해 직접 해체해야 했던 결함을 다룹니다. 잘못된 답변이 초래하는 피해의 크기 순으로 배열했습니다.
아무것도 검증되지 않았을 때 출력이 무엇이라고 말하는지 물어보십시오
첫 번째 질문은 거의 아무도 던지지 않는 질문입니다. 시스템이 무언가를 검증할 수 없을 때, 결과는 정확히 무엇이라고 표시합니까? 통과 또는 실패만 보고하는 검증 단계는 1비트만 다룰 수 있지만, 그 뒤에는 최소 네 가지 상태가 놓여 있습니다. 검증했고 문제가 없음, 검증했고 문제가 있음, 검증할 대상이 없음, 검증할 수 없었음입니다. 뒤의 두 상태가 첫 번째 상태로 뭉개지면, 읽는 사람에게 문제없는 결과와 아무 말도 하지 않은 결과는 구분되지 않습니다. 그 차이는 이후 단계에서 아무리 주의를 기울여도 복구되지 않습니다. 좋은 답변은 명시적인 제3의 상태를 제시합니다. 나쁜 답변은 모든 것이 통과하는 시연입니다.
그다음으로, 유난히 깨끗한 결과가 무엇을 촉발하는지 확인하십시오. 같은 종류의 문서가 통상 담고 있는 것보다 검증할 항목이 적은 문서는 그 자체로 하나의 신호입니다. 시스템이 이를 이유를 되묻게 만드는 계기가 아니라 안심의 근거로 취급한다면, 가장 조용한 실패는 끝내 드러나지 않습니다.
그리고 그 검증이 실제로 무엇을 대상으로 수행되었는지 물어보십시오. 결과는 작업 집합에 대한 정직한 진술, 즉 몇 개 항목이 범위에 포함되었고 그것이 무엇이었는지와 함께 놓일 때에만 해석할 수 있습니다. 결과는 보고하면서 모집단은 보고하지 않는 공급업체는 측정의 절반만 보고한 뒤 그것을 전체인 양 제시하는 것입니다.
기준 정답이 어디에서 오는지 물어보십시오
검증이 대조하는 증거를 누가 만들었는지 물어보십시오. 주장을 만든 쪽이 그 주장을 대조할 자료까지 만들었다면, 손에 쥔 것은 진정성 검증의 옷을 입은 일관성 검증입니다. 그것은 내부적으로 정합적이어서 모든 부분이 서로 들어맞겠지만, 자기 바깥의 무엇과 일치하라는 요구는 한 번도 받은 적이 없습니다. 이것이 우리 감사 추적에서 발견한 결함이며, 두 동료가 이 질문의 불편한 버전을 소리 내어 던지고 논쟁 대신 실제 시스템에 대고 시험한 끝에 드러났습니다.
폐지된 조항이 어떻게 처리되는지 물어보십시오. 성문법 체계에서 전형적인 실패는 조작된 인용이 아닙니다. 실재하는 조문을 정확히 인용했지만, 그 조문이 더 이상 시행 중인 법이 아닌데도 여전히 현행법으로 인용되는 경우입니다. 공급업체가 폐지를 그 자체로 하나의 판정이 아니라 누락된 레코드나 오류로 취급한다면, 그 시스템은 텍스트가 존재하는지를 확인할 뿐 그것이 규율하는지를 확인하지 않습니다.출처: 폐지된 법률이 낡은 사실이 아닌 이유
출처에 붙은 타임스탬프가 실제로 무엇을 뜻하는지 물어보십시오. 대부분의 검색(retrieval) 시스템에서 그것은 누군가가 그 레코드를 마지막으로 손댄 시점을 기록할 뿐, 거기에 적힌 내용이 여전히 참인지는 기록하지 않습니다. 이 둘은 답이 서로 다른 별개의 질문이며, 그 간극에 확신에 찬 오답이 자리 잡습니다.
실제로 업무를 수행하는 관할권에 대해 물어보십시오
색인된 관할권, 코퍼스가 수집되기만 한 관할권, 그리고 모델이 일반 지식만으로 추론할 수 있는 관할권의 차이를 물어보십시오. 셋 모두 시연에서는 똑같아 보일 수 있습니다. 실제 출처에 대한 검색(retrieval)을 제공하는 것은 첫 번째뿐입니다. 그 선을 그어 주지 않는 공급업체라면, 그 커버리지 수치는 뒷받침할 수 없는 역할을 떠맡고 있는 것입니다.
모델링하지 않은 관할권을 시스템이 어떻게 처리하는지 물어보십시오. 가능한 답은 두 가지이고 그중 안전한 것은 하나뿐입니다. 응답을 거부하거나, 인접 관할권의 규칙을 적용해 무언가를 만들어 내는 것입니다. 기한이 걸린 사안이라면 두 번째가 더 나쁜 결과입니다. 그럴듯한 날짜가 그대로 실행되고, 제출은 늦어지며, 그 시점에 바로잡을 수 있는 것은 남아 있지 않습니다. 거부하는 장면을 직접 보여 달라고 요청하십시오.
검증 로직이 실제로 작동할 언어를 위해 설계되었는지, 아니면 그 언어로 번역된 것인지 물어보십시오. 법적 주장이 미묘하게 어긋나는 방식, 즉 부정이 뒤집히거나 양화사가 약해지거나 예외가 빠지는 방식은 언어마다 다른 패턴입니다. 한 언어에서 적대적으로 시험한 시스템이 다른 언어에서 동일한 실패를 잡아낸다는 보장은 없으며, 그 실패는 오류가 아니라 침묵으로 나타납니다.출처: 검증은 번역을 따라가지 않습니다
틀렸을 때 무슨 일이 벌어지는지 물어보십시오
그 분석이 어느 직역 관점에서 작성되었는지 물어보십시오. 동일한 계약과 동일한 법률이라도 질문이 공정증서를 작성할 수 있는지인지, 어떤 기재가 등기 가능한지인지, 언제 제출해야 하는지인지에 따라 도출되는 결론은 달라집니다. 소송 변호사에게는 무관한 결함이 등기관에게는 결정적인 결론일 수 있습니다. 출력이 어느 직역 관점에서 작성되었는지 밝히지 않는다면, 그 시스템은 이미 조용히 하나를 골라 놓은 것입니다.
하나의 결함이 포트폴리오 전체에서 얼마의 비용을 발생시키는지 물어보십시오. 지친 전문가의 오류는 흩어지지만, 결함이 있는 모델은 그 패턴이 재현될 때마다 모든 사건에서 동시에 같은 오류를 냅니다. 이는 평균적으로 어느 쪽이 더 정확한가에 관한 주장이 아닙니다. 상관되지 않은 오류는 수많은 판단에 걸쳐 상쇄되지만 상관된 오류는 누적된다는 것이며, 총계 수준의 안심은 그 오류가 떨어진 사건 파일에 아무런 도움이 되지 않습니다.출처: 신뢰의 비대칭
마지막으로, 그 자리에 없었던 사람에게 기록이 어떻게 보이는지 물어보십시오. 로그가 있는지를 묻는 것이 아닙니다. 모든 시스템은 로그를 남깁니다. 무엇이 검증되었고 무엇이 검증되지 않았는지, 그 검증이 무엇을 대상으로 수행되었는지, 누가 책임을 지는지를, 규제기관이나 상대방이 공급업체의 말에 기대지 않고 평가할 수 있는 형태로 그 기록이 보여 주는지 물어보십시오. 이것이 감사 가능한 시스템과 감사 추적만 갖춘 시스템의 차이입니다.
답변을 읽는 법
이 질문들 가운데 정답이 하나로 정해진 것은 없으며, 열두 가지 모두에 망설임 없이 답하는 공급업체는 탁월하거나 이미 같은 질문을 듣고 준비해 둔 것입니다. 중요한 것은 답변의 형태입니다. 유창함보다 구체성이 낫습니다. 안심시키는 말보다 명시된 한계가 낫습니다. 모든 것이 작동하는 시연보다 실패 사례를 보여 주겠다는 제안이 낫습니다.
계약 이후가 아니라 계약 전에 물어야 하는 이유는, 이러한 결함 대부분이 피해를 일으키는 바로 그 순간에 외부에서 보이지 않기 때문입니다. 발견한 문제만 보고하는 시스템은 구조상 애초에 찾지 않은 문제에 대해서는 할 말이 없습니다.
이 글은 의견 및 사고 리더십 콘텐츠입니다. 법률 또는 재무 자문이 아닙니다.
더 많은 인사이트
2026년 8월 19일
규정이 바뀌었을 때, 귀사는 무엇을 해야 했습니까?2026년 8월 12일
신뢰의 비대칭: 우리는 왜 인간의 실수를 용서하고 기계의 실수를 두려워하는가2026년 8월 11일
대리 지표는 언제나 자기 자신의 시험을 통과합니다