Originality AI 是一項以網頁為基礎的文字檢查服務,營運主體為加拿大公司 Originality AI Inc,註冊地址位於安大略省科林伍德市 Hurontario 街 64 號。它接收一段文字,回傳兩項主要判定:該文字由 AI 模型生成的可能性評分,以及針對既有已發表材料的抄襲比對。環繞這兩項,還配有文法、可讀性、事實查核、內容品質評分與規範合規等一組輔助檢查。
公司由 Jon Gillham 在出售自己創辦的內容行銷機構後創立,服務於 2022 年 11 月上線——值得注意的是這早於 ChatGPT 公開發布,當時它是為偵測 GPT-3 輸出而打造的。這個時間點正是其自稱首個商用 AI 偵測器的依據。
本文其餘部分都取決於一個區分,所以有必要先講清楚。官網把產品描述為「在第三方研究中最準確的 AI 偵測器」。而公司公布的準確率數字——99%、99%+、97.8%,以及 0.5% 至 2.4% 的偽陽性率——取自其自家基準表中標註為「Internal Benchmark」(內部基準)的資料集。這些是廠商自行執行、在廠商自行挑選的資料上得出的測試結果,沒有任何一項經過獨立稽核。 與此同時,關於這個問題現存的同行評審文獻,對偵測工具這一整個品類得出了明顯不同的結論。下文會把兩方面都攤開來,因為要判斷是否要仰賴這個工具,讀者兩邊都需要看到。
目前有三個偵測模型,均於 2025 年 9 月發布,廠商為每一個都給出了具體宣稱。Lite 1.0.2 宣稱對主流旗艦模型——OpenAI、Gemini、Claude 與 DeepSeek——達到 99% 準確率,偽陽性率 0.5%。Turbo 3.0.2 宣稱在同樣這些模型上達到 99%+,對「人性化」改寫內容最高 97% 準確率,偽陽性率 1.5%。Academic 0.0.5 宣稱 99%+ 準確率、偽陽性率低於 1%,專注學術材料(含 STEM 答案、程式碼與公式),對 AI 人性化與繞過工具最高 92% 準確率。
這些就是行銷所倚仗的數字,而它們值得與廠商為其給出的來源對照著讀。公布的基準表把 Lite 1.0.2 列為真陽性率 98.91%、偽陽性率 0.52%、偽陰性率 1.09%——所針對的資料集,在廠商自己的表頭一欄中寫著「Internal Benchmark: Recently Released Models」。
2026 年 6 月推出的 AI Allowance 偏離了此前每個偵測器都在問的二元問題。它不問「這是不是 AI」,而是讓你設定願意接受多少 AI 參與——0%、5%、15%、25% 或 40%——並依該閾值評分。廠商宣稱在預設的 15% 設定下準確率為 99%+。
從概念上說這是產品中最有意思的東西,因為它承認了二元框架所掩蓋的一件事:2026 年現實世界中的多數寫作,都落在完全人工與完全機器之間的光譜上,而編輯政策通常在意的是程度而非有無。至於底層測量是否真的撐得起這種更細的區分,同樣只有內部測試作證。
2025 年 5 月發布的 Multilingual 2.0.0 模型涵蓋 30 種語言,宣稱整體準確率 97.8%、偽陰性率降至 1.99%、偽陽性率 2.4%。
最後這個數字值得注意,因為它是廠商自己揭露的、非英語偵測明顯較弱的證據:2.4% 的偽陽性率對應 Lite 的 0.5% 與 Academic 的低於 1%。任何在評估非英語文字的人,依公司自己的數字,面對的是英文模型大約二到五倍的偽陽性率。
抄襲偵測是與 AI 偵測並列的產品線而非附加項——創辦人自述的動機之一,就是做一個帶掃描歷史、可分享結果與團隊存取的現代抄襲偵測方案。環繞這兩根支柱的是事實查核器、文法檢查器、可讀性檢查器、內容品質評分與規範檢查器,另有面向批次作業的 Bulk Scan,以及輸入網址即可爬取的整站掃描。
Chrome 擴充功能可直接在 Google Docs 內執行掃描,並能重播寫作過程——展示一份文件是如何隨時間被逐步寫成的,而不只是對成品下判斷。這是與偵測評分性質完全不同的證據:過程證據而非統計推論,而且偽造難度高得多。對於試圖確認學生是否真的自己寫作的教師來說,一段顯示出自然起草過程的重播,比任何百分比都更有說服力。
在透明度上,這家公司做得比多數同業更多:2023 年 8 月它發布了開源基準資料集與開源效果測試工具。在一個多數廠商什麼都不公布的品類裡,這是實實在在且不常見的一步。
但要與兩項相反的事實一併衡量。當前旗艦模型的準確率數字仍來自內部基準而非那份開放資料集;而服務條款禁止逆向工程、反編譯或試圖推導模型、權重、提示詞與非公開基準——這意味著外部無法獨立驗證目前的系統究竟如何得出結論。
Enterprise 方案明確定位於內容代理商與出版方,而這恰恰是該工具的侷限影響最小的場景。當編輯在核對一位自由撰稿人交付的是否為約定內容時,偵測評分是一次對話的輸入項,而不是帶有後果的判決。批次掃描與整站掃描讓它在規模上可行。
AI Allowance 適合那些真的寫下過政策的組織——比如「AI 可用於資料研究與擬大綱,但成文的散文必須出自你手」——而不是一刀切禁令。設定一個與政策相符的閾值,比假裝一個二元偵測器能執行一條有層次的規則要誠實得多。
Academic 模型、Moodle 外掛與學生資料條款都說明這一細分被有意服務。但這也正是該工具自身條款施加最嚴格限制的地方,下文會詳述。作為若干訊號之一使用——與寫作重播、草稿歷史或一次與學生的談話並用——它能起作用。作為決定性依據使用,則違反廠商自己的可接受使用政策。
任何在邀稿、評估投稿或判斷產品評論是否真實的人,都有正當的使用需求,而此時偽陽性的後果是相稱的——你退掉一份投稿,而不是懲罰一個人。
一個常被忽略的用法:以正式、結構化文體寫作的人——這描述了相當多的非英語母語寫作者、技術寫作者與學者——可以先檢查自己的文字是否可能被標記,從而預先知道自己或許需要提出說明。這是該工具的一種防禦性用法,它的批評者很少提及。
無需帳號即可每天掃描 3 次、單次最多 2,000 字。請把它用在來源你已完全確知的文字上——你自己寫的一段,以及你確知由機器生成的一段——以便在花錢之前校準你的預期。
請注意其中的取捨:輸入免費偵測器的文字可能被用於訓練,退出該用途需要付費帳戶。不要把機密材料或客戶材料貼進免費工具。
Lite、Turbo 與 Academic 並不可以互換。Academic 為 STEM 答案、程式碼與公式而建,回報的偽陽性率最低。Turbo 是對抗人性化工具較穩健的選擇。如果你的文字不是英語,適用的是多語言模型,其偽陽性率為較高的 2.4%。
如果你在使用 AI Allowance,請把百分比設成與你真正寫下來的政策相符。因為覺得「嚴格」而選 0%,而你的實際政策其實容許 AI 輔助研究,只會產生一堆你隨後會忽略的標記——那反而會訓練你徹底不再信任這個工具。
這一步決定了你使用這個工具是否負責任。高 AI 評分意味著該文字具備與機器生成相似的統計特徵,它並不確立該文字是如何被寫出來的。正式的文體、簡單的詞彙、經過大量編輯的行文,以及非母語的措辭,都會因為與 AI 使用無關的原因把評分推高。
如果結果可能影響到某個人,請蒐集其他訊號:版本歷史、寫作重播、可供對照的早前寫作樣本,或者一次談話。這不是我個人的謹慎建議——如下文所述,這正是廠商條款對你的要求。
1 點數等於 100 字。訂閱點數在每月結束時過期且不結轉;單獨購買的按量付費點數則可保留兩年。如果你的工作量不均衡,走按量付費可以避免每月為最終損失掉的額度付費。
Enterprise 提供 365 天掃描歷史,Pro 未標明同等的保留期。如果偵測結果有可能參與到關於人的決定中,能夠回溯當時掃描了什麼、何時掃描,僅憑這一點就值回方案差價。
服務條款第 9 條禁止把輸出當作重大決定的唯一依據,並禁止僅因偵測或抄襲分數而懲罰學生、員工、承包商、寫作者或申請人。如果你正在設計一套機構工作流程,這一條應當形塑它的樣貌。廠商把這寫下來既不常見也值得稱許;同時它對作為使用者的你具有拘束力。
在規模化部署之前,請用一組你確知由人類撰寫、且來自你將要評估的同一族群的文字跑一遍——相同主題、相同語言背景、相同文體。廠商的基準對你的具體語料毫無說明力,而這是了解你自己那份偽陽性率究竟是多少的唯一辦法。
廠商自己的數字把多語言偽陽性率定在 2.4%,而英文 Lite 模型是 0.5%。如果你在評估翻譯文字或非英語寫作,請相應調低你的信心水準。
在關於這類系統如何運作的所有公開說明中,偵測可靠性都隨文字長度提升而提升,包括 OpenAI 自己關於其分類器在低於 1,000 字元時不可靠的說明。對一個自然段的標記,其意義近乎為零。
如果你能拿到過程證據,它比評分更有力。一段顯示文件在數小時內被起草、修訂與重構的重播,是任何百分比都無法提供的、支持人類作者身分的正面證據。
免費方案的輸入可能被用於訓練,只有付費帳戶能退出。客戶作品、未發表的手稿,以及含個人資料的學生繳交物,如果要掃描,也只應放進付費帳戶。
已查證的評價者反映退訂路徑難以走完。無論你如何看待這一點,實務上的因應是:遠早於續訂日取消、以書面形式確認,並檢查下一個計費週期。
出版方、內容代理商與內容交易平台最契合,因為該工具參與的決定是商業性而非針對個人的——接受或拒絕一件作品——而批次與整站掃描的工具形態也與它們的運作方式相符。
已寫下 AI 政策的編輯團隊能從 AI Allowance 上獲得實質價值,因為基於閾值的工具與基於閾值的政策相符,這是二元偵測器做不到的。
教育工作者與機構是被有意服務的——Academic 模型、Moodle 外掛、學生資料保護——但在圍繞它搭建任何流程之前,應完整讀完本文的限制章節,並把廠商自身對「唯一依據式決定」的禁令當作設計約束而非小字條款。
檢查自己作品的寫作者,尤其是以正式文體寫作或以英語為附加語言寫作的人,有一種真正防禦性的用途。
該看別處的人:任何尋求證明而非機率的人,在這裡和在任何競品那裡都找不到,因為這個底層問題目前並不容許證明。想把學術不端認定自動化的機構,明確處在廠商所允許的範圍之外。任何主要評估非英語寫作的人,都應認真權衡那個較高的已揭露偽陽性率。而任何無法容忍一小部分帶有真實後果的錯誤答案的人,根本就不該使用自動偵測。
Originality AI 以帶控制台的網頁應用形式交付,並透過 Chrome 擴充功能(在 Google Docs 內執行掃描並提供寫作重播)、面向教育機構的 Moodle 外掛、供程式化使用的 API 與企業整合觸達其他環境。檔案上傳支援 docx、doc 與 PDF,另可貼上或直接輸入文字,整站掃描則接收一個網址。
API 存取屬 Enterprise 方案功能,Pro 方案不提供。免費工具——AI 檢查器、事實查核器、抄襲檢查器、可讀性與文法檢查器——以獨立頁面的形式掛在站點上。
共公布兩個訂閱方案,均以美元計價,年付相對月付有折扣。
Pro 為年付每月 12.95 美元(年帳單 155.40 美元)或月付 14.95 美元,定位於個人與小團隊。含每月 2,000 點數,1 點數等於 100 字——約合每月 20 萬字的掃描量。包含標準支援、檔案上傳、整站掃描、團隊管理、掃描標籤與 Chrome 擴充功能。團隊席次另計,每席每月 9.95 美元,年付為 8.62 美元。
Enterprise 為年付每月 136.58 美元(年帳單 1,638.96 美元)或月付 179 美元,定位於內容代理商與出版方。含每月 15,000 點數、專屬客戶成功經理、優先支援(問題通常一小時內解決)、365 天掃描歷史與 API 存取。席次另計,每席每月 24.95 美元,年付 19.04 美元。
免費存取無需帳號即可使用:每天 3 次掃描、單次最多 2,000 字。以此方式提交的文字可能被用於訓練,只有付費帳戶能退出。
有兩條點數機制比標價更值得注意。訂閱點數若未使用,在每月結束時過期——它們不會累積。而一次性付款購買的按量付費點數,自購買之日起兩年內有效。如果你的用量是季節性或依專案波動的,走按量付費可以避免每月為隨後蒸發掉的額度付費。
退款方面條款很直接:取消只停止後續續訂,不會自動退還已發生的扣款;除法律要求或訂單表另有明示外,費用一經支付不予退款;已消耗的服務——已完成的掃描、抄襲偵測、API 呼叫——不可退款。條款同時保留了依法不可拋棄的強制性消費者權利。
GPTZero 是教育細分中最直接的競爭者,同樣公布自家的準確率宣稱,並帶著同樣的根本性附註——廠商自行測試。用你自己那份來源已知的語料去比較兩者,比比較它們的行銷材料有用得多。
Turnitin 憑藉既有的教學系統關係與長期累積的抄襲偵測基礎設施,在機構端具有份量;對大學而言,整合路徑與採購流程往往在準確率之前就決定了答案。它也是下文所述 Weber-Wulff 評測中被納入的兩個商用系統之一。
Copyleaks 在 AI 偵測與抄襲兩側競爭,尤其強調多語言涵蓋。如果你的語料以非英語為主,考量到該場景下較高的已揭露偽陽性率,這一點可能有實際意義。
Winston AI 等較新的入局者以價格以及關於識別人性化工具輸出的具體宣稱競爭。同樣的證據審慎標準,對它們一視同仁地適用。
不使用自動偵測值得作為一個真實選項列出。過程證據——草稿歷史、版本控制、口頭答辯、課堂內寫作——產出的是你真正站得住腳的結論,已有若干機構有意識地轉向這條路。它更費力也難以規模化,但它不帶偽陽性率。
誠實的總結是:在一個核心宣稱結構性地難以驗證的品類裡,Originality AI 屬於較為透明的廠商之一。它公布了模型迭代史,發布過開源基準工具,並把使用上的明確限制寫進了自己的條款。這些都不能解決底層問題——任何偵測器是否準確到足以支撐帶後果的用途——而獨立文獻傾向於認為,這個品類作為整體還不夠。
這是核心附註,且無一例外地適用。99%、99%+、97.8%,以及 0.5% 至 2.4% 的偽陽性率,全部由公司自行測試、在其基準表標註為「Internal Benchmark」的資料集上得出。沒有獨立稽核機構驗證過它們。這不是對其誠信的指控——這是對這些數字證據地位的描述,而且在整個品類裡,這是常態。
與之相關的那句宣稱也需要精確表述。官網把產品描述為「在第三方研究中最準確的 AI 偵測器」。公司自家的準確率文章裡確有一個承諾概述第三方研究的章節標題,但該頁面上呈現的實質準確率資料來自內部基準。想要找到足以佐證首頁那句話的第三方研究,在那裡找不到相應的引文。
現存最有份量的獨立評測出自 Weber-Wulff 等人之手,論文題為《對 AI 生成文字偵測工具的測試》(英文原題 Testing of detection tools for AI-generated text),發表在《國際教育誠信學刊》上,為該刊第 19 卷第 26 篇,出版年份為 2023 年。該研究測試了 12 個公開偵測工具與 2 個商用系統,結論是現有偵測工具「既不準確也不可靠」,並存在把 AI 內容誤判為人類撰寫的顯著偏向。研究進一步發現內容混淆手段會顯著削弱工具表現,作者據此強調在學術場景使用此類系統會帶來嚴重影響。
該研究並未單獨針對 Originality AI,且其所測模型早於當前這一代。但它是這個品類現存最接近獨立評估的東西,而它的結論與任何廠商的 99% 宣稱都難以調和。
由史丹佛大學的梁偉欣(Liang)、Yuksekgonul、毛、吳與鄒五位研究者合作的論文,題為《GPT 偵測器對非英語母語寫作者存在偏見》(英文原題 GPT detectors are biased against non-native English writers),編號 arXiv 2304.02819,於 2023 年 4 月提交、同年 7 月定稿。他們的發現是:偵測器持續把非英語母語者的寫作誤判為 AI 生成,同時對母語者的寫作判定準確。他們還證明簡單的提示改寫既能減輕這種偏差,也能繞過偵測——這個結果從兩個方向同時削弱了偵測的可靠性。
Originality AI 公開作出了回應,文章標題為《對一項有缺陷的史丹佛研究的回應》。該回應對方法論提出質疑。值得注意的是,它同時複述了該研究的核心數字而未加否認:偵測器把超過半數的 TOEFL 作文誤判為 AI 生成,平均偽陽性率為 61.3%。
讀者應自行從這場交鋒中得出結論。沒有爭議的是:誤判非母語寫作的風險,是一個雙方都承認其存在的、已被記錄並發表的問題。
關於這個問題究竟有多難,最清楚的指示來自那家打造被偵測模型的公司本身。OpenAI 的分類器頁面上寫著:「自 2023 年 7 月 20 日起,該 AI 分類器因準確率過低而不再提供。」其公布的效能是:「在英文挑戰集上正確識別 26% 的 AI 撰寫文字(真陽性)為『可能由 AI 撰寫』,同時把 9% 的人類撰寫文字誤判為 AI 撰寫(偽陽性)。」
這不是對 Originality AI 具體模型的評價——後者宣稱的數字要好得多。這是關於這個品類贏得了多少懷疑的背景。
對教育或人力資源領域的任何人來說,這是本文中最重要的一件事,而且它出自公司自身。服務條款第 9 條禁止使用者把輸出「用作可能對個人產生法律、學術、就業、住房、保險、信用、紀律、聲譽、醫療或類似重大影響的決定的唯一依據」,並特別禁止「僅因 AI 偵測輸出或抄襲分數」而去「指控、處分、懲罰、解僱、判定不及格、舉報或以其他方式實質性不利對待學生、員工、承包商、寫作者、申請人或其他人」。第 8 條要求你「在採取任何可能實質影響個人的行動之前,使用人工複核與適當的正當程序」。
直白地讀:廠商一邊宣傳自己是最準確的偵測器,一邊禁止你把它的輸出當作足以讓一名學生不及格或讓一名員工被解僱的依據。這兩個立場各自都站得住,而把它們並置的誠實程度高於多數競品。但一個採用該工具來自動化不端認定的機構,正在違反它已同意的條款。
即使全盤接受公司的數字,算術仍然重要。依 Academic 模型宣稱的低於 1% 偽陽性率,掃描一千份真正由人類撰寫的作業,仍可能有接近十份被標記。依多語言模型的 2.4%,絕對數量還要更高。那些在行銷材料中看起來令人安心的百分比,一旦施加於一整屆學生,描述的是相當數量的具體的人。
Trustpilot 檔案的評分為 4.6、共 1,294 則評價——樣本量很大——分布為 5 星 80%、4 星 6%、3 星 1%、2 星 1%、1 星 12%。
有兩條限定。該檔案自 2023 年 9 月起被廠商認領,Trustpilot 標註該公司主動邀請評價,且廠商已回覆 89% 的負面評價——這些都會把選擇壓力推向正面。更實質的一點是:逐則閱讀近期正面評價可以看到,它們高度集中於客服體驗,反覆點名具體的支援人員,而非偵測準確性。這個 4.6 分最好被讀作關於公司回應度的訊號,而不是使用者對偵測器正確性的背書。
負面一側,一條反覆出現的具體抱怨關於取消訂閱。一位已查證的評價者稱退訂連結「極小、隱蔽,字體近乎完全透明」,隨後是約八次挽留報價,並稱一旦選擇提交回饋,取消就變得在字面意義上無法完成,帳戶轉而被置為暫停狀態。
訂閱點數不結轉——未用完的額度在月底作廢。取消只停止後續續訂,不退還已發生的扣款,已消耗的掃描與 API 呼叫不可退。對用量不均衡的場景,兩年有效的按量付費選項在結構上更合適。
條款禁止逆向工程、反編譯或試圖推導原始碼、演算法、模型權重、提示詞、系統設計與非公開基準。這是標準的商業保護,但與內部產生的準確率數字結合起來看,意味著該產品的核心宣稱在設計上就無法由外部查核。
廠商自己的模型歷史顯示,其最難測試集上的準確率在一次發布中從 90.2% 提升到 98.8%,而同一步中偽陽性率僅從 2.9% 微降至 2.8%。這條軌跡反映的是一個移動的靶子:人性化與繞過工具與偵測器同步進化,今天公布的數字描述的是面對該次測試執行時所存在的規避手段時的表現。
公司宣稱其當前英文模型達到 99% 或更高,偽陽性率介於 0.5% 與低於 1% 之間;30 語種的多語言模型整體 97.8%,偽陽性率 2.4%。這些全部來自公司自行在標註為「Internal Benchmark」的資料集上的測試,沒有一項經過獨立稽核。針對偵測工具這一品類的獨立同行評審工作——最著名的是 Weber-Wulff 等 2023 年的研究——得出的結論是現有工具「既不準確也不可靠」。請把廠商數字當作宣稱,而非測量結果。
會,而且廠商直接揭露了相應比率。更重要的是,已發表研究記錄了這種風險分布並不均勻:一項史丹佛研究發現,偵測器把非英語母語者的寫作誤判為 AI 生成的頻率遠高於母語者,在 TOEFL 作文上的平均偽陽性率為 61.3%。Originality AI 對該研究的方法論提出質疑,同時複述了這組數字。正式文體、簡單詞彙與大量編輯,都會因與 AI 使用無關的原因把評分推高。
不能僅憑它——而且這是廠商自己的規則,不只是建議。服務條款禁止把輸出用作具有學術、就業或紀律後果的決定的唯一依據,並特別禁止僅因偵測或抄襲分數而懲罰學生、員工、承包商、寫作者或申請人。條款還要求在任何可能實質影響個人的行動之前進行人工複核與適當的正當程序。
Pro 為年付每月 12.95 美元或月付 14.95 美元,含每月 2,000 點數。Enterprise 為年付每月 136.58 美元或月付 179 美元,含 15,000 點數、API 存取、365 天掃描歷史與優先支援。1 點數等於 100 字。兩個方案的額外席次均需另行付費。另有免費方案,每天 3 次掃描、單次最多 2,000 字,無需帳號。
有——每天 3 次掃描、單次最多 2,000 字,無需帳號。代價是輸入免費偵測器的文字可能被用於訓練,且只有付費帳戶能退出。不要用它處理機密材料或客戶材料。
訂閱方案不會。訂閱點數若未使用,在每月結束時過期。單獨購買的按量付費點數自購買之日起兩年後過期,更適合不規律的工作量。
支援,透過涵蓋 30 種語言的多語言模型,廠商宣稱整體準確率 97.8%。請注意同一份揭露把該模型的偽陽性率定在 2.4%,而英文 Lite 模型為 0.5%——依廠商自己的數字,明顯較高。
廠商宣稱 Turbo 3.0.2 識別人性化內容的準確率最高 97%,Academic 0.0.5 對人性化與繞過工具穩健、最高 92%。這些是內部數字。偵測與規避同步演進,因此任何此類數字描述的都是面對測試執行當時所能取得的繞過技術時的表現。
Trustpilot 的分布是 1,294 則評價中 4.6 分,5 星 80%、1 星 12%。正面評價集中在客服而非偵測準確性。反覆出現的負面主題是取消訂閱困難——一位已查證的評價者描述退訂連結近乎不可見、約八次挽留報價,以及在選擇提交回饋後無法完成取消。
不能,任何競品也不能。偵測評分是一個統計可能性,而不是關於文字如何產生的證據。該產品能提供的最具證明力的東西不是評分,而是其 Chrome 擴充功能中的寫作重播,它記錄了一份文件實際是怎樣被寫成的。這類過程證據遠強於任何百分比——而這也正是多數站得住腳的學術誠信實踐一直在走的方向。