Originality AI는 캐나다 온타리오주 콜링우드 허론테리오 스트리트 64번지에 등록된 Originality AI Inc가 운영하는 웹 기반 텍스트 검사 서비스입니다. 글 한 편을 받아 두 가지 주요 판정을 돌려줍니다. 그 텍스트가 AI 모델로 생성되었을 가능성을 나타내는 점수, 그리고 기존에 공개된 자료와 대조한 표절 검사입니다. 그 둘을 둘러싸고 문법, 가독성, 사실 확인, 콘텐츠 품질 점수, 가이드라인 준수 여부 같은 보조 검사가 함께 제공됩니다.
회사는 Jon Gillham이 자신이 창업한 콘텐츠 마케팅 대행사를 매각한 뒤 설립했고, 서비스는 2022년 11월에 출시되었습니다. 주목할 점은 이 시점이 ChatGPT 공개보다 앞선다는 것으로, 당시에는 GPT-3 출력을 탐지하기 위해 만들어졌습니다. 최초의 상업용 AI 탐지기라는 자사 주장의 근거가 바로 이 시점입니다.
이 글의 나머지 전부가 하나의 구분에 달려 있으므로 먼저 짚습니다. 홈페이지는 제품을 "제3자 연구에서 가장 정확한 AI 탐지기"라고 설명합니다. 그런데 회사가 공개하는 정확도 수치들 — 99%, 99%+, 97.8%, 그리고 0.5%에서 2.4%에 이르는 거짓 양성률 — 은 자사 벤치마크 표가 "Internal Benchmark"(내부 벤치마크)라고 표기한 데이터셋에서 나온 것입니다. 업체가 스스로 돌린 시험을, 업체가 스스로 고른 데이터에서 낸 결과이며 그중 어느 것도 독립적으로 감사받지 않았습니다. 한편 이 문제를 다룬 동료심사 문헌은 탐지 도구라는 범주 전체에 대해 뚜렷하게 다른 결론에 이릅니다. 아래에서 양쪽을 모두 제시합니다. 이 도구에 의존할지 판단하려는 독자에게는 양쪽이 다 필요하기 때문입니다.
현재 모델은 세 가지이며 2025년 9월에 공개되었고, 업체는 각각에 대해 구체적인 수치를 제시합니다. Lite 1.0.2는 주요 플래그십 모델 — OpenAI, Gemini, Claude, DeepSeek — 에 대해 99% 정확도와 0.5% 거짓 양성률을 표방합니다. Turbo 3.0.2는 같은 모델들에 대해 99%+, "인간화" 처리된 콘텐츠에 최대 97% 정확도, 거짓 양성률 1.5%를 표방합니다. Academic 0.0.5는 99%+ 정확도와 1% 미만 거짓 양성률을 내세우며, STEM 답안·코드·수식을 포함한 학술 자료에 초점을 맞추고 AI 인간화 및 우회 도구에 대해 최대 92% 정확도를 주장합니다.
이것이 마케팅이 기대고 있는 숫자이며, 업체가 밝힌 출처와 나란히 읽을 가치가 있습니다. 공개된 벤치마크 표는 Lite 1.0.2를 참 양성률 98.91%, 거짓 양성률 0.52%, 거짓 음성률 1.09%로 기재하는데, 그 대상 데이터셋은 업체 자신의 열 제목에 "Internal Benchmark: Recently Released Models"라고 적혀 있습니다.
2026년 6월 도입된 AI Allowance는 지금까지 모든 탐지기가 던져 온 이분법적 질문에서 벗어납니다. "이것이 AI인가"를 묻는 대신, 어느 정도의 AI 개입까지 수용할지를 사용자가 설정하고 — 0%, 5%, 15%, 25%, 40% — 그 기준에 맞춰 점수를 매깁니다. 업체는 기본값인 15% 설정에서 99%+ 정확도를 주장합니다.
개념적으로는 제품에서 가장 흥미로운 지점입니다. 이분법이 가려 온 사실, 즉 2026년 현실의 글 대부분은 완전한 사람과 완전한 기계 사이 어딘가에 놓이며 편집 정책이 신경 쓰는 것은 유무가 아니라 정도라는 점을 인정하기 때문입니다. 다만 밑바탕의 측정이 그 미세한 구분을 실제로 지탱하는지는 역시 내부 시험만이 증언합니다.
2025년 5월 공개된 Multilingual 2.0.0 모델은 30개 언어를 다루며 전체 정확도 97.8%, 거짓 음성률 1.99%, 거짓 양성률 2.4%를 표방합니다.
마지막 수치가 주목할 만합니다. 비영어 탐지가 측정 가능하게 더 약하다는 사실을 업체 스스로 밝힌 것이기 때문입니다. Lite의 0.5%, Academic의 1% 미만에 견줘 2.4%입니다. 영어가 아닌 텍스트를 평가하는 사람은 회사 자신의 숫자에 따르더라도 영어 모델의 약 두 배에서 다섯 배에 이르는 거짓 양성률을 안고 작업하는 셈입니다.
표절 탐지는 부가 기능이 아니라 대등한 제품 라인입니다. 창업자가 밝힌 동기 가운데 하나가 스캔 이력, 공유 가능한 결과, 팀 접근 권한을 갖춘 현대적 표절 검사기를 만드는 것이었습니다. 이 두 축을 둘러싸고 사실 확인기, 문법 검사기, 가독성 검사기, 콘텐츠 품질 점수, 가이드라인 검사기가 있고, 대량 작업용 Bulk Scan과 URL을 받아 크롤링하는 전체 사이트 스캔이 더해집니다.
크롬 확장은 Google Docs 안에서 바로 스캔을 실행하며 작성 과정을 재생할 수 있습니다. 완성된 텍스트만 놓고 판단하는 대신, 문서가 시간에 걸쳐 어떻게 쓰였는지를 보여 주는 것입니다. 이는 탐지 점수와는 성격이 다른 증거입니다. 통계적 추론이 아니라 과정 증거이고, 위조하기가 훨씬 어렵습니다. 학생이 정말 스스로 썼는지 확인하려는 교사에게는, 자연스러운 초고 작성 과정을 보여 주는 재생이 어떤 백분율보다 유용합니다.
투명성 면에서 이 회사는 경쟁사 대부분보다 많은 일을 했습니다. 2023년 8월 오픈소스 벤치마크 데이터셋과 오픈소스 효능 테스트 도구를 공개했습니다. 대부분의 업체가 아무것도 공개하지 않는 범주에서 이는 진짜이고 흔치 않은 진전입니다.
다만 상반된 두 사실과 함께 저울질해야 합니다. 현재 주력 모델의 정확도 수치는 여전히 그 공개 데이터셋이 아니라 내부 벤치마크에서 나오며, 이용약관은 모델·가중치·프롬프트·비공개 벤치마크에 대한 역설계, 디컴파일, 도출 시도를 금지합니다. 즉 외부에서는 현재 시스템이 어떻게 결론에 이르는지 독립적으로 검증할 수 없습니다.
Enterprise 요금제는 대행사와 출판사를 겨냥한다고 명시되어 있고, 이 도구의 한계가 가장 덜 문제되는 사용처가 바로 여기입니다. 편집자가 프리랜서의 납품물이 의뢰한 것과 맞는지 확인할 때, 탐지 점수는 대화의 입력값이지 결과를 동반한 판결이 아닙니다. 대량 스캔과 전체 사이트 스캔은 이를 규모 있게 만들어 줍니다.
AI Allowance는 실제로 정책을 문서로 써 둔 조직에 맞습니다. "AI는 조사와 개요 작성에 써도 되지만 문장은 당신이 써야 한다" 같은 정책이지, 전면 금지가 아닙니다. 정책에 대응하는 임계값을 설정하는 편이, 이분법 탐지기가 층위 있는 규칙을 집행할 수 있는 척하는 것보다 훨씬 정직합니다.
Academic 모델, Moodle 플러그인, 학생 데이터 조항은 이 부문이 의도적으로 지원되고 있음을 보여 줍니다. 그러나 여기가 이 도구 자체의 약관이 가장 강한 제한을 두는 지점이기도 하며, 아래에서 자세히 다룹니다. 여러 신호 가운데 하나로 — 작성 재생, 초고 이력, 학생과의 대화와 함께 — 쓰면 기여할 수 있습니다. 결정적 근거로 쓰면 업체 자신의 허용 사용 정책을 위반하게 됩니다.
콘텐츠를 의뢰하거나 기고를 심사하거나 제품 리뷰의 진위를 가늠하는 사람에게는 정당한 필요가 있고, 이때 거짓 양성의 결과는 비례적입니다. 사람을 처벌하는 것이 아니라 원고를 반려하는 것이기 때문입니다.
자주 간과되는 용도가 있습니다. 격식 있고 구조적인 문체로 쓰는 사람 — 상당수의 비영어 모어 필자, 기술 문서 작성자, 연구자가 여기 해당합니다 — 은 자기 글이 표시될 가능성이 있는지 미리 확인하고, 설명이 필요할 수도 있음을 사전에 알 수 있습니다. 비판자들이 좀처럼 언급하지 않는, 이 도구의 방어적 사용법입니다.
계정 없이 하루 3회, 회당 최대 2,000단어까지 스캔할 수 있습니다. 출처를 이미 확실히 아는 텍스트에 써 보십시오. 직접 쓴 글 하나와 기계가 생성한 것이 확실한 글 하나를 넣어, 돈을 쓰기 전에 기대치를 보정하는 것입니다.
맞바꿈을 유념하십시오. 무료 탐지기에 입력한 텍스트는 학습에 사용될 수 있고, 이를 거부하려면 유료 계정이 필요합니다. 기밀 자료나 고객 자료를 무료 도구에 붙여 넣지 마십시오.
Lite, Turbo, Academic은 서로 대체 가능하지 않습니다. Academic은 STEM 답안·코드·수식을 위해 만들어졌고 가장 낮은 거짓 양성률을 보고합니다. Turbo는 인간화 도구에 더 강건한 선택지입니다. 텍스트가 영어가 아니라면 다국어 모델이 적용되며 더 높은 2.4% 거짓 양성률을 안게 됩니다.
AI Allowance를 쓴다면 실제로 문서화한 정책에 맞춰 백분율을 정하십시오. 엄격해 보인다는 이유로 0%를 골랐는데 실제 정책은 AI 보조 조사를 허용한다면, 결국 무시하게 될 표시만 쏟아집니다. 그러면 도구 자체를 신뢰하지 않도록 스스로를 길들이게 됩니다.
이 도구를 책임 있게 쓰는지 여부가 이 단계에서 갈립니다. 높은 AI 점수는 그 텍스트가 기계 생성과 닮은 통계적 특성을 지녔다는 뜻입니다. 그 텍스트가 어떻게 만들어졌는지를 확정하지는 않습니다. 격식 있는 문체, 단순한 어휘, 여러 번 다듬은 문장, 비모어 화자 특유의 표현 모두가 AI 사용과 무관한 이유로 점수를 밀어 올립니다.
결과가 누군가에게 영향을 줄 수 있다면 다른 신호를 모으십시오. 버전 이력, 작성 재생, 비교할 이전 글 표본, 또는 대화입니다. 이는 제 개인적 신중함이 아니라, 아래에서 보듯 업체 약관이 사용자에게 요구하는 바입니다.
1크레딧은 100단어입니다. 구독 크레딧은 매달 말에 소멸하며 이월되지 않고, 별도로 구매한 종량제 크레딧은 2년간 유지됩니다. 업무량이 고르지 않다면 종량제가 매달 잃게 될 용량에 돈을 내는 일을 피하게 해 줍니다.
Enterprise는 365일 스캔 이력을 제공하고 Pro는 이에 상응하는 보관 기간을 명시하지 않습니다. 탐지 결과가 사람에 관한 결정에 관여할 여지가 있다면, 무엇을 언제 스캔했는지 되짚을 수 있다는 점만으로도 요금제 차액의 값어치가 있습니다.
이용약관 제9조는 출력을 중대한 결정의 유일한 근거로 삼는 것을 금지하고, 탐지 또는 표절 점수만을 이유로 학생·직원·계약자·필자·지원자를 제재하는 것을 금지합니다. 기관 워크플로를 설계 중이라면 이 조항이 그 형태를 규정해야 합니다. 업체가 이를 문서로 못 박은 것은 이례적이고 평가받을 만하며, 동시에 사용자인 당신을 구속합니다.
규모 있게 도입하기 전에, 앞으로 평가할 집단과 같은 사람들이 쓴 것이 확실한 텍스트 묶음으로 한 번 돌려 보십시오. 같은 주제, 같은 언어 배경, 같은 문체여야 합니다. 업체 벤치마크는 당신의 실제 말뭉치에 대해 아무것도 말해 주지 않으며, 당신 자신의 거짓 양성률이 얼마인지 알 방법은 이것뿐입니다.
업체 자신의 수치가 다국어 거짓 양성률을 2.4%로, 영어 Lite 모델을 0.5%로 제시합니다. 번역문이나 비영어 글을 평가한다면 그에 맞춰 확신의 정도를 낮추십시오.
이런 시스템의 작동 방식에 관한 모든 공개 설명에서 탐지 신뢰도는 텍스트 길이에 따라 올라갑니다. 자사 분류기가 1,000자 미만에서는 신뢰할 수 없다고 밝힌 OpenAI의 설명도 여기에 포함됩니다. 한 문단에 붙은 표시는 사실상 의미가 없습니다.
과정 증거를 확보할 수 있다면 그것이 점수보다 강합니다. 문서가 몇 시간에 걸쳐 초고에서 수정과 재구성을 거치는 모습을 보여 주는 재생은, 어떤 백분율도 제공할 수 없는 방식으로 사람이 썼다는 적극적 증거가 됩니다.
무료 요금제의 입력은 학습에 쓰일 수 있고, 유료 계정만 이를 거부할 수 있습니다. 고객 작업물, 미발표 원고, 개인정보가 담긴 학생 제출물은 굳이 스캔한다면 유료 계정에서만 다뤄야 합니다.
확인된 이용자들이 구독 해지 경로를 끝까지 밟기 어렵다고 보고합니다. 이를 어떻게 보든 실무적 대응은 같습니다. 갱신일보다 훨씬 앞서 해지하고, 서면으로 확인받고, 다음 결제 주기를 점검하십시오.
출판사, 대행사, 콘텐츠 마켓플레이스가 가장 잘 맞습니다. 이 도구가 관여하는 결정이 개인을 향한 것이 아니라 상업적인 것 — 작업물의 수용 또는 반려 — 이고, 대량 및 사이트 전체 스캔이라는 도구 형태가 이들의 운영 방식과 맞물리기 때문입니다.
AI 정책을 문서화한 편집팀은 특히 AI Allowance에서 실질적 가치를 얻습니다. 임계값 기반 도구가 임계값 기반 정책과 맞물리는 방식은 이분법 탐지기가 결코 해낼 수 없는 것입니다.
교육자와 기관은 의도적으로 지원되지만 — Academic 모델, Moodle 플러그인, 학생 데이터 보호 — 이를 중심으로 어떤 절차든 세우기 전에 이 글의 한계 항목을 끝까지 읽어야 하며, 업체 자신의 "유일 근거 금지" 조항을 작은 글씨가 아니라 설계 제약으로 다뤄야 합니다.
자기 글을 점검하는 필자, 특히 격식 있는 문체로 쓰거나 영어를 추가 언어로 쓰는 사람에게는 진짜로 방어적인 쓰임새가 있습니다.
다른 곳을 봐야 할 분: 확률이 아니라 증명을 찾는 사람은 여기서도 어떤 경쟁 제품에서도 찾지 못합니다. 밑바탕의 문제가 현재로서는 증명을 허용하지 않기 때문입니다. 학술 부정행위 판정을 자동화하려는 기관은 업체가 허용하는 범위 밖에 명확히 놓입니다. 주로 비영어 글을 평가하는 사람은 더 높게 공개된 거짓 양성률을 신중히 저울질해야 합니다. 그리고 실제 결과가 따르는 오답을 일정 비율 감수할 수 없는 사람은 애초에 자동 탐지를 써서는 안 됩니다.
Originality AI는 대시보드를 갖춘 웹 애플리케이션으로 제공되며, 크롬 확장(Google Docs 안에서 스캔을 실행하고 작성 재생을 제공), 교육기관용 Moodle 플러그인, 프로그래밍 방식 사용을 위한 API, 기업 연동을 통해 다른 환경에 닿습니다. 파일 업로드는 docx, doc, PDF를 지원하고 텍스트를 붙여 넣거나 직접 입력할 수도 있으며, 사이트 스캔은 URL을 받습니다.
API 접근은 Pro가 아니라 Enterprise 요금제 기능입니다. 무료 도구 — AI 검사기, 사실 확인기, 표절 검사기, 가독성 및 문법 검사기 — 는 사이트에 독립 페이지로 노출됩니다.
공개된 구독 요금제는 둘이며 모두 미국 달러로 청구되고, 연간 결제가 월간 대비 할인됩니다.
Pro는 연간 결제 시 월 12.95달러(연 155.40달러), 월간 결제 시 14.95달러이며 개인과 소규모 팀을 겨냥합니다. 월 2,000크레딧이 포함되고 1크레딧은 100단어이므로 대략 월 20만 단어 분량입니다. 표준 지원, 파일 업로드, 전체 사이트 스캔, 팀 관리, 스캔 태그, 크롬 확장이 포함됩니다. 팀 좌석 추가는 월 9.95달러, 연간 결제 시 8.62달러입니다.
Enterprise는 연간 결제 시 월 136.58달러(연 1,638.96달러), 월간 결제 시 179달러이며 대행사와 출판사를 겨냥합니다. 월 15,000크레딧, 전담 고객 성공 매니저, 통상 한 시간 이내 해결되는 우선 지원, 365일 스캔 이력, API 접근이 포함됩니다. 좌석 추가는 월 24.95달러, 연간 19.04달러입니다.
무료 이용은 계정 없이 가능합니다. 하루 3회, 회당 최대 2,000단어입니다. 이렇게 제출한 텍스트는 학습에 사용될 수 있고, 유료 계정만 이를 거부할 수 있습니다.
표시 가격보다 더 중요한 크레딧 규칙이 둘 있습니다. 구독 크레딧은 쓰지 않으면 매달 말에 소멸하며 누적되지 않습니다. 반면 일시불로 구매한 종량제 크레딧은 구매일로부터 2년간 유효합니다. 사용량이 계절을 타거나 프로젝트 단위라면 종량제 쪽이 매달 사라질 용량에 돈을 내는 일을 피하게 해 줍니다.
환불에 대해 약관은 직설적입니다. 해지는 향후 갱신을 멈출 뿐 이미 발생한 청구를 자동으로 환불하지 않고, 법률이나 주문서에 달리 정하지 않는 한 지급된 요금은 환불되지 않으며, 이미 소비된 서비스 — 완료된 스캔, 표절 검사, API 호출 — 는 환불되지 않습니다. 다만 포기할 수 없는 강행 소비자 권리는 약관이 그대로 보존합니다.
GPTZero는 교육 부문에서 가장 직접적인 경쟁자이며, 동일한 근본적 단서 — 업체 자체 시험 — 를 달고 자사 정확도를 공개합니다. 출처를 아는 당신 자신의 말뭉치로 둘을 비교하는 편이 두 회사의 마케팅을 비교하는 것보다 유익합니다.
Turnitin은 기존 학습관리시스템 관계와 오래 축적된 표절 인프라를 통해 기관 쪽에서 무게를 갖습니다. 대학에서는 통합 경로와 조달 절차가 정확도보다 먼저 답을 정하는 경우가 많습니다. 아래에서 다루는 Weber-Wulff 평가에 포함된 두 상용 시스템 중 하나이기도 합니다.
Copyleaks는 AI 탐지와 표절 양쪽에서 경쟁하며 특히 다국어 범위를 강조합니다. 말뭉치가 주로 비영어라면, 해당 환경에서 공개된 거짓 양성률이 더 높다는 점을 감안할 때 의미가 있을 수 있습니다.
Winston AI 등 비교적 새로운 진입자들은 가격과, 인간화 도구 출력을 잡아낸다는 구체적 주장으로 경쟁합니다. 동일한 증거상의 신중함이 이들 모두에게 똑같이 적용됩니다.
자동 탐지를 쓰지 않는 선택도 실제 대안으로 적어 둘 만합니다. 과정 증거 — 초고 이력, 버전 관리, 구술 방어, 수업 중 작성 — 는 실제로 방어할 수 있는 결론을 낳고, 여러 기관이 의식적으로 이 방향으로 이동했습니다. 손이 더 가고 규모 확장이 어렵지만, 거짓 양성률을 동반하지 않습니다.
정직한 요약은 이렇습니다. 핵심 주장이 구조적으로 검증하기 어려운 범주 안에서, Originality AI는 비교적 투명한 축에 듭니다. 모델 출시 이력을 공개했고, 오픈 벤치마크 도구를 배포한 적이 있으며, 사용상의 명시적 한계를 자사 약관에 써 넣었습니다. 그 어느 것도 근본 질문 — 어떤 탐지기가 결과를 동반한 용도를 감당할 만큼 정확한가 — 을 해결하지는 못하며, 독립 문헌은 이 범주가 전체적으로 그렇지 못하다고 시사합니다.
이것이 핵심 단서이며 예외 없이 적용됩니다. 99%, 99%+, 97.8%, 그리고 0.5%에서 2.4%에 이르는 거짓 양성률은 전부 회사가 스스로 시험해, 벤치마크 표가 "Internal Benchmark"라고 표기한 데이터셋에서 낸 것입니다. 어떤 독립 감사기관도 이를 검증하지 않았습니다. 이는 부정직에 대한 고발이 아니라 그 숫자들의 증거 지위에 대한 서술이며, 이 범주 전체에서 통상적인 상태입니다.
관련된 주장도 정확히 짚어야 합니다. 홈페이지는 제품을 "제3자 연구에서 가장 정확한 AI 탐지기"라고 설명합니다. 회사 자신의 정확도 문서에는 제3자 연구 개관을 약속하는 절 제목이 있지만, 그 페이지에 제시된 실질적 정확도 데이터는 내부 벤치마크에서 나옵니다. 홈페이지 문구를 뒷받침할 제3자 연구를 찾는 독자는 거기서 해당 인용을 발견하지 못합니다.
가장 무게 있는 독립 평가는 Weber-Wulff 연구진이 쓴 논문으로, 제목은 「AI 생성 텍스트 탐지 도구에 대한 시험」이며 영어 원제는 Testing of detection tools for AI-generated text입니다. 국제 교육진실성 학술지에 실렸고 해당 학술지 제19권 26호, 발행 연도는 2023년입니다. 공개된 탐지 도구 12종과 상용 시스템 2종을 시험했고, 사용 가능한 탐지 도구가 "정확하지도 신뢰할 만하지도 않다"고 결론지었으며 AI 콘텐츠를 사람이 쓴 것으로 잘못 분류하는 뚜렷한 편향이 있다고 밝혔습니다. 나아가 콘텐츠 난독화 기법이 도구 성능을 크게 악화시킨다는 점을 확인하고, 학술 현장에서 이런 시스템을 쓰는 데 따르는 심각한 함의를 강조했습니다.
이 연구가 Originality AI만을 겨냥한 것은 아니며, 시험한 모델들은 현재 세대보다 앞섭니다. 그러나 이 범주에 대해 존재하는 독립 평가에 가장 가까운 것이고, 그 결론은 어떤 업체의 99% 주장과도 조화시키기 어렵습니다.
스탠퍼드 대학의 Liang, Yuksekgonul, Mao, Wu, Zou 다섯 연구자가 함께 쓴 논문으로, 제목은 「GPT 탐지기는 비영어 모어 필자에게 편향되어 있다」이며 영어 원제는 GPT detectors are biased against non-native English writers입니다. 사전 공개 번호는 arXiv 2304.02819이고 2023년 4월에 제출되어 같은 해 7월 최종본이 나왔습니다. 이들의 발견은 탐지기가 비영어 모어 필자의 글을 지속적으로 AI 생성으로 오분류하는 반면 모어 화자의 글은 정확히 분류한다는 것입니다. 또한 단순한 프롬프트 조정만으로 이 편향을 줄일 수도, 탐지를 우회할 수도 있음을 보였습니다. 탐지 신뢰도를 양방향에서 동시에 깎아내리는 결과입니다.
Originality AI는 「결함 있는 스탠퍼드 연구에 대한 답변」이라는 제목의 글로 공개 반박했습니다. 이 답변은 방법론에 이의를 제기합니다. 주목할 점은, 동시에 그 연구의 핵심 수치를 부인하지 않고 다시 옮긴다는 것입니다. 탐지기가 TOEFL 에세이의 절반 이상을 AI 생성으로 잘못 표시했고 평균 거짓 양성률이 61.3%였다는 수치입니다.
독자는 이 공방에서 스스로 결론을 내려야 합니다. 다툼이 없는 사실은, 비모어 화자의 글을 오분류할 위험이 양측 모두 존재를 인정하는, 기록되고 발표된 사안이라는 점입니다.
이 문제가 얼마나 어려운지에 대한 가장 분명한 지표는 탐지 대상 모델을 만드는 회사 자신에게서 나옵니다. OpenAI의 분류기 페이지에는 이렇게 적혀 있습니다. "2023년 7월 20일부로 이 AI 분류기는 낮은 정확도로 인해 더 이상 제공되지 않습니다." 공개된 성능은 "영어 챌린지 세트에서 AI가 쓴 텍스트의 26%를 '아마도 AI가 작성'으로 올바르게 식별하는 한편, 사람이 쓴 텍스트의 9%를 AI 작성으로 잘못 표시"하는 수준이었습니다.
이는 Originality AI의 구체적 모델에 대한 평가가 아닙니다. 후자가 주장하는 수치는 훨씬 낫습니다. 이 범주가 얼마만큼의 회의를 얻어 냈는지에 대한 배경입니다.
교육이나 인사 분야에 있는 사람에게는 이 글에서 가장 중요한 대목이며, 회사 자신에게서 나온 내용입니다. 이용약관 제9조는 이용자가 출력을 "개인에게 법적·학술적·고용·주거·보험·신용·징계·평판·의료 또는 그와 유사하게 중대한 영향을 줄 수 있는 결정의 유일한 근거"로 삼는 것을 금지하고, 특히 "AI 탐지 출력이나 표절 점수만을 이유로" 학생·직원·계약자·필자·지원자 등을 "고발, 징계, 처벌, 해고, 낙제 처리, 신고하거나 그 밖의 방식으로 실질적으로 불리하게 대우"하는 행위를 금지합니다. 제8조는 "개인에게 실질적 영향을 줄 수 있는 조치를 취하기 전에 인간의 검토와 적절한 적법 절차를 사용"할 것을 요구합니다.
곧이곧대로 읽으면, 업체는 가장 정확한 탐지기라고 홍보하면서 동시에 그 출력을 학생을 낙제시키거나 직원을 해고할 근거로 삼는 것을 금지합니다. 두 입장 모두 나름의 근거가 있고, 이를 함께 견지하는 것은 경쟁사 대부분보다 정직합니다. 그러나 부정행위 판정을 자동화하려고 이 도구를 도입한 기관은 자신이 동의한 약관을 위반하고 있는 것입니다.
회사 수치를 액면 그대로 받아들여도 산수는 여전히 문제입니다. Academic 모델이 표방하는 1% 미만 거짓 양성률로 계산하면, 진짜 사람이 쓴 과제 천 편을 스캔할 때 열 편 가까이가 여전히 표시될 수 있습니다. 다국어 모델의 2.4%라면 절대 수는 더 커집니다. 마케팅에서 안심되어 보이는 백분율이, 한 학년 전체에 적용되면 상당한 수의 구체적인 사람을 가리키게 됩니다.
Trustpilot 프로필은 1,294개 리뷰에 4.6점이며 — 표본이 큽니다 — 5점 80%, 4점 6%, 3점 1%, 2점 1%, 1점 12%로 분포합니다.
두 가지 단서가 붙습니다. 이 프로필은 2023년 9월부터 업체가 소유권을 주장했고, Trustpilot은 회사가 적극적으로 리뷰를 요청한다고 표시하며, 업체는 부정적 리뷰의 89%에 답변했습니다. 모두 선택 압력을 긍정 쪽으로 미는 요인입니다. 더 실질적인 점은, 최근 긍정 리뷰를 읽어 보면 탐지 정확도가 아니라 고객 지원 경험에 크게 몰려 있다는 것입니다. 개별 지원 담당자의 이름이 반복해서 등장합니다. 이 4.6점은 탐지기의 정확성에 대한 이용자 인증이 아니라 회사의 응대에 관한 신호로 읽는 편이 맞습니다.
부정적인 쪽에서는 해지에 관한 구체적 불만이 반복됩니다. 확인된 한 리뷰어는 구독 해지 링크가 "극도로 작고, 잘 숨겨져 있으며, 거의 완전히 투명한 글꼴"이라고 묘사하고, 이어 여덟 번가량의 리텐션 제안이 나오며, 피드백 제출을 선택하면 해지를 끝내는 것이 사실상 불가능해지고 계정이 일시정지 상태로 바뀐다고 적었습니다.
구독 크레딧은 이월되지 않아 쓰지 않은 용량은 월말에 사라집니다. 해지는 향후 갱신을 멈출 뿐 이미 발생한 청구를 환불하지 않으며, 이미 소비된 스캔과 API 호출은 환불되지 않습니다. 사용량이 고르지 않다면 2년 유효한 종량제 쪽이 구조적으로 더 맞습니다.
약관은 소스 코드, 알고리즘, 모델 가중치, 프롬프트, 시스템 설계, 비공개 벤치마크에 대한 역설계·디컴파일·도출 시도를 금지합니다. 표준적인 상업적 보호이지만, 내부에서 생성한 정확도 수치와 겹쳐 놓고 보면 이 제품의 핵심 주장이 설계상 외부에서 확인 불가능하다는 뜻이 됩니다.
업체 자신의 모델 이력은 가장 어려운 테스트 세트에서 정확도가 한 번의 릴리스에 90.2%에서 98.8%로 올라간 반면, 같은 단계에서 거짓 양성률은 2.9%에서 2.8%로 미미하게만 개선되었음을 보여 줍니다. 이 궤적이 반영하는 것은 움직이는 표적입니다. 인간화 및 우회 도구는 탐지기와 나란히 진화하며, 오늘 공개된 수치는 그 시험이 수행되던 시점에 존재하던 회피 기법을 상대로 한 성능을 서술할 뿐입니다.
회사는 현재 영어 모델에 대해 99% 이상, 거짓 양성률 0.5%에서 1% 미만을 제시하고, 30개 언어 다국어 모델에 대해서는 전체 97.8%, 거짓 양성률 2.4%를 제시합니다. 이 모두가 "Internal Benchmark"로 표기된 데이터셋에서 회사가 스스로 시험한 결과이며, 어느 것도 독립 감사를 받지 않았습니다. 탐지 도구 범주 전반에 대한 독립 동료심사 연구 — 대표적으로 Weber-Wulff 등 2023 — 는 사용 가능한 도구가 "정확하지도 신뢰할 만하지도 않다"고 결론지었습니다. 업체 수치는 측정값이 아니라 주장으로 다루십시오.
그렇습니다. 업체도 그 비율을 직접 공개합니다. 더 중요한 것은 발표된 연구가 이 위험이 고르게 분포하지 않음을 기록했다는 점입니다. 스탠퍼드 연구는 탐지기가 비영어 모어 필자의 글을 모어 화자의 글보다 훨씬 자주 AI 생성으로 오분류하며, TOEFL 에세이에서 평균 거짓 양성률이 61.3%였다고 밝혔습니다. Originality AI는 그 연구의 방법론에 이의를 제기하면서도 이 수치를 다시 옮깁니다. 격식 있는 문체, 단순한 어휘, 잦은 퇴고 모두 AI 사용과 무관한 이유로 점수를 올립니다.
이것만으로는 안 됩니다. 그리고 이는 조언이 아니라 업체 자신의 규칙입니다. 이용약관은 출력을 학술·고용·징계 결과가 따르는 결정의 유일한 근거로 삼는 것을 금지하고, 탐지 또는 표절 점수만을 이유로 학생·직원·계약자·필자·지원자를 제재하는 것을 특히 금지합니다. 또한 개인에게 실질적 영향을 줄 수 있는 조치 이전에 인간의 검토와 적절한 적법 절차를 요구합니다.
Pro는 연간 결제 시 월 12.95달러, 월간 결제 시 14.95달러이고 월 2,000크레딧이 포함됩니다. Enterprise는 연간 결제 시 월 136.58달러, 월간 179달러이며 15,000크레딧, API 접근, 365일 스캔 이력, 우선 지원이 포함됩니다. 1크레딧은 100단어입니다. 두 요금제 모두 좌석 추가는 별도 비용입니다. 계정 없이 하루 3회, 회당 2,000단어까지 쓰는 무료 이용도 있습니다.
있습니다. 계정 없이 하루 3회, 회당 최대 2,000단어입니다. 대가는 무료 탐지기에 입력한 텍스트가 학습에 사용될 수 있다는 점이고, 유료 계정만 이를 거부할 수 있습니다. 기밀 자료나 고객 자료에는 쓰지 마십시오.
구독은 이월되지 않습니다. 구독 크레딧은 쓰지 않으면 매달 말에 소멸합니다. 별도로 구매한 종량제 크레딧은 구매일로부터 2년 후 만료되며, 불규칙한 업무량에 더 적합합니다.
됩니다. 30개 언어를 다루는 다국어 모델이 있고 업체는 전체 정확도 97.8%를 제시합니다. 다만 같은 공개 자료가 이 모델의 거짓 양성률을 2.4%로, 영어 Lite 모델을 0.5%로 적고 있다는 점에 유의하십시오. 업체 자신의 수치로도 뚜렷하게 높습니다.
업체는 Turbo 3.0.2가 인간화 콘텐츠를 최대 97% 정확도로 식별하고, Academic 0.0.5가 인간화 및 우회 도구에 최대 92%로 강건하다고 주장합니다. 내부 수치입니다. 탐지와 회피는 함께 진화하므로, 이런 수치는 시험이 수행된 시점에 존재하던 우회 기법을 상대로 한 성능을 서술할 뿐입니다.
Trustpilot 분포는 1,294개 리뷰에 4.6점이며 5점 80%, 1점 12%입니다. 긍정 리뷰는 탐지 정확도가 아니라 고객 지원에 몰려 있습니다. 반복되는 부정적 주제는 해지의 어려움으로, 확인된 한 리뷰어는 거의 보이지 않는 해지 링크, 여덟 번가량의 리텐션 제안, 그리고 피드백 제출을 선택한 뒤 해지를 끝내지 못한 상황을 묘사합니다.
없습니다. 어떤 경쟁 제품도 마찬가지입니다. 탐지 점수는 통계적 가능성이지 텍스트가 어떻게 만들어졌는지에 대한 증거가 아닙니다. 이 제품이 제공하는 가장 증명력 있는 것은 점수가 아니라 크롬 확장의 작성 재생이며, 문서가 실제로 어떻게 쓰였는지를 기록합니다. 그런 종류의 과정 증거는 어떤 백분율보다 훨씬 강하며, 방어 가능한 학술 진실성 실무가 줄곧 향해 온 방향이기도 합니다.