
Originality AI ist ein in Kanada entwickelter TextprĂŒfer, der fĂŒr Verlage, Agenturen und Lehrende KI-Generierung und Plagiate bewertet; die Genauigkeitswerte sind selbst berichtet, und die eigenen Bedingungen untersagen es, die Werte als alleinige Grundlage fĂŒr Sanktionen zu nutzen.
Hast du dieses Tool genutzt? Bewerte es
Hast du dieses Tool genutzt? Bewerte es
Originality AI ist ein webbasierter TextprĂŒfdienst, betrieben von Originality AI Inc, einem kanadischen Unternehmen mit Sitz in der 64 Hurontario St in Collingwood, Ontario. Der Dienst nimmt einen Text entgegen und liefert zwei wesentliche Urteile: einen Wert dafĂŒr, wie wahrscheinlich der Text von einem KI-Modell erzeugt wurde, sowie eine PlagiatsprĂŒfung gegen bereits veröffentlichtes Material. Darum herum liegen ergĂ€nzende PrĂŒfungen â Grammatik, Lesbarkeit, FaktenprĂŒfung, inhaltliche QualitĂ€tsbewertung und RichtlinienkonformitĂ€t.
GegrĂŒndet wurde das Unternehmen von Jon Gillham, nachdem er eine von ihm aufgebaute Content-Marketing-Agentur verkauft hatte; der Dienst startete im November 2022 â bemerkenswerterweise vor der öffentlichen Freigabe von ChatGPT, als er zur Erkennung von GPT-3-Ausgaben gebaut war. Auf dieser zeitlichen PrioritĂ€t beruht der Anspruch, der erste kommerziell verfĂŒgbare KI-Detektor gewesen zu sein.
Alles Weitere in diesem Text hĂ€ngt an einer Unterscheidung, also gehört sie an den Anfang. Die Startseite beschreibt das Produkt als âden genauesten KI-Detektor in Studien Dritter". Die Genauigkeitswerte, die das Unternehmen veröffentlicht â 99 %, 99 %+, 97,8 % sowie Falsch-Positiv-Raten von 0,5 % bis 2,4 % â stammen jedoch aus DatensĂ€tzen, die die eigenen Benchmark-Tabellen als âInternal Benchmark" ausweisen. Es sind Tests des Anbieters auf vom Anbieter gewĂ€hlten Daten, und keiner davon wurde unabhĂ€ngig geprĂŒft. Zugleich kommt die vorhandene begutachtete Fachliteratur zu diesem Problem fĂŒr Erkennungswerkzeuge als Gattung zu einem deutlich anderen Schluss. Beide Seiten stehen unten, denn wer entscheiden muss, ob er sich auf dieses Werkzeug verlĂ€sst, braucht beide.
Drei Erkennungsmodelle sind aktuell, veröffentlicht im September 2025, und der Anbieter nennt fĂŒr jedes eine konkrete Zahl. Lite 1.0.2 wird mit 99 % Genauigkeit auf fĂŒhrenden Flaggschiffmodellen angegeben â OpenAI, Gemini, Claude und DeepSeek â bei einer Falsch-Positiv-Rate von 0,5 %. Turbo 3.0.2 wird mit 99 %+ auf denselben Modellen angegeben, mit bis zu 97 % Genauigkeit auf âhumanisierten" Inhalten und einer Falsch-Positiv-Rate von 1,5 %. Academic 0.0.5 wird mit 99 %+ und unter 1 % Falsch-Positiven angegeben, ausgerichtet auf akademisches Material einschlieĂlich MINT-Antworten, Code und Formeln, und mit bis zu 92 % Genauigkeit gegen KI-Humanizer- und Bypasser-Werkzeuge.
Auf diesen Zahlen ruht das Marketing, und es lohnt sich, sie neben der Quelle zu lesen, die der Anbieter fĂŒr sie angibt. Die veröffentlichte Benchmark-Tabelle fĂŒhrt Lite 1.0.2 mit einer Richtig-Positiv-Rate von 98,91 %, einer Falsch-Positiv-Rate von 0,52 % und einer Falsch-Negativ-Rate von 1,09 % â gegen einen Datensatz, den die SpaltenĂŒberschrift des Anbieters selbst âInternal Benchmark: Recently Released Models" nennt.
Im Juni 2026 eingefĂŒhrt, bricht AI Allowance mit der binĂ€ren Frage, die bislang jeder Detektor gestellt hat. Statt âist das KI oder nicht" legen Sie fest, wie viel KI-Beteiligung Sie akzeptieren â 0 %, 5 %, 15 %, 25 % oder 40 % â und das Werkzeug bewertet gegen diese Schwelle. Der Anbieter beansprucht 99 %+ Genauigkeit bei der Voreinstellung von 15 %.
Konzeptionell ist das der interessanteste Teil des Produkts, weil er anerkennt, was die binĂ€re Rahmung verdeckt: Die meisten realen Texte des Jahres 2026 liegen auf einem Kontinuum zwischen vollstĂ€ndig menschlich und vollstĂ€ndig maschinell, und eine redaktionelle Richtlinie interessiert sich in der Regel fĂŒr den Grad, nicht fĂŒr das bloĂe Vorhandensein. Ob die zugrundeliegende Messung diese feinere Unterscheidung tatsĂ€chlich trĂ€gt, bezeugen wiederum nur interne Tests.
Das im Mai 2025 veröffentlichte Modell Multilingual 2.0.0 deckt 30 Sprachen ab, mit angegebener Gesamtgenauigkeit von 97,8 %, auf 1,99 % gesenkten Falsch-Negativen und einer Falsch-Positiv-Rate von 2,4 %.
Der letzte Wert verdient Beachtung, denn es ist die eigene Offenlegung des Anbieters, dass die Erkennung auĂerhalb des Englischen messbar schwĂ€cher ist: 2,4 % Falsch-Positive gegenĂŒber 0,5 % bei Lite und unter 1 % bei Academic. Wer Texte in einer anderen Sprache als Englisch bewertet, arbeitet nach den Zahlen des Unternehmens selbst mit etwa der zwei- bis fĂŒnffachen Falsch-Positiv-Rate der englischen Modelle.
Die Plagiatserkennung ist eine gleichrangige Produktlinie und kein Zusatz â zur erklĂ€rten Motivation des GrĂŒnders gehörte, einen modernen PlagiatsprĂŒfer mit Scan-Historie, teilbaren Ergebnissen und Teamzugriff zu bauen. Um diese beiden SĂ€ulen gruppieren sich FaktenprĂŒfer, GrammatikprĂŒfer, LesbarkeitsprĂŒfer, inhaltliche QualitĂ€tsbewertung und RichtlinienprĂŒfer, dazu Bulk Scan fĂŒr Mengen und vollstĂ€ndige Website-Scans, die eine URL entgegennehmen.
Die Chrome-Erweiterung fĂŒhrt Scans direkt in Google Docs aus und kann den Schreibprozess wiedergeben â sie zeigt, wie ein Dokument ĂŒber die Zeit entstanden ist, statt nur den fertigen Text zu beurteilen. Das ist eine grundsĂ€tzlich andere Art von Beleg als ein Erkennungswert: Prozessbeleg statt statistischer Schlussfolgerung, und erheblich schwerer zu fĂ€lschen. FĂŒr Lehrende, die feststellen wollen, ob eine SchĂŒlerin einen Text selbst geschrieben hat, ist eine Wiedergabe, die organisches Entwerfen zeigt, aussagekrĂ€ftiger als jeder Prozentwert.
Beim Thema Transparenz hat das Unternehmen mehr getan als die meisten Wettbewerber: Im August 2023 veröffentlichte es einen quelloffenen Benchmark-Datensatz und quelloffene Werkzeuge zur WirksamkeitsprĂŒfung. In einer Kategorie, in der die meisten Anbieter nichts veröffentlichen, ist das ein echter und ungewöhnlicher Schritt.
Er ist gegen zwei gegenlĂ€ufige Tatsachen abzuwĂ€gen. Die Genauigkeitswerte der aktuellen Spitzenmodelle stammen weiterhin aus internen Benchmarks und nicht aus jenem offenen Datensatz, und die Nutzungsbedingungen untersagen Reverse Engineering, Dekompilieren oder den Versuch, Modelle, Gewichte, Prompts oder nicht öffentliche Benchmarks abzuleiten â womit AuĂenstehende nicht unabhĂ€ngig prĂŒfen können, wie das gegenwĂ€rtige System zu seinen Ergebnissen kommt.
Die Enterprise-Stufe ist ausdrĂŒcklich fĂŒr Agenturen und Verlage positioniert, und hier wiegen die Grenzen des Werkzeugs am wenigsten. Wenn eine Redakteurin prĂŒft, ob eine freie Autorin geliefert hat, was beauftragt war, ist ein Erkennungswert ein GesprĂ€chsbeitrag und kein folgenreiches Urteil. Stapel- und seitenweite Scans machen das im Volumen praktikabel.
AI Allowance passt zu Organisationen, die tatsĂ€chlich eine Richtlinie geschrieben haben â âKI-UnterstĂŒtzung ist fĂŒr Recherche und Gliederung in Ordnung, die Prosa muss von Ihnen stammen" â statt zu einem pauschalen Verbot. Eine Schwelle zu setzen, die der Richtlinie entspricht, ist ehrlicher, als so zu tun, als könnte ein binĂ€rer Detektor eine abgestufte Regel durchsetzen.
Academic-Modell, Moodle-Plugin und die Bestimmungen zu SchĂŒlerdaten zeigen, dass dieses Segment bewusst bedient wird. Doch genau hier setzen die eigenen Bedingungen des Werkzeugs die schĂ€rfsten Grenzen, wie unten ausgefĂŒhrt. Als ein Signal unter mehreren â neben einer Schreibwiedergabe, einer Entwurfshistorie oder einem GesprĂ€ch mit der Studierenden â kann es beitragen. Als ausschlaggebender Faktor verstöĂt es gegen die Nutzungsrichtlinie des Anbieters selbst.
Wer Inhalte beauftragt, einen Gastbeitrag bewertet oder einschĂ€tzt, ob Produktbewertungen echt sind, hat hier ein berechtigtes BedĂŒrfnis, und die Folgen eines Falsch-Positivs sind verhĂ€ltnismĂ€Ăig â Sie lehnen eine Einreichung ab, statt eine Person zu sanktionieren.
Eine oft ĂŒbersehene Verwendung: Wer in einem formellen, strukturierten Register schreibt â das trifft auf sehr viele nicht-muttersprachliche Schreibende, technische Redakteure und Wissenschaftlerinnen zu â kann prĂŒfen, ob die eigene Prosa wahrscheinlich markiert wird, und weiĂ im Voraus, ob er sich womöglich erklĂ€ren muss. Das ist eine defensive Verwendung, die Kritiker selten erwĂ€hnen.
Drei Scans pro Tag mit bis zu 2.000 Wörtern sind ohne Konto verfĂŒgbar. Nutzen Sie sie an Texten, deren Herkunft Sie sicher kennen â etwas, das Sie selbst geschrieben haben, und etwas, von dem Sie wissen, dass es maschinell erzeugt wurde â um Ihre Erwartungen zu kalibrieren, bevor Sie Geld einsetzen.
Beachten Sie den Handel: In den kostenlosen Detektor eingegebener Text kann zum Training verwendet werden. Ein Widerspruch erfordert ein Bezahlkonto. FĂŒgen Sie kein vertrauliches oder Kundenmaterial in das kostenlose Werkzeug ein.
Lite, Turbo und Academic sind nicht austauschbar. Academic ist fĂŒr MINT-Antworten, Code und Formeln gebaut und meldet die niedrigste Falsch-Positiv-Rate. Turbo ist die robustere Option gegen Humanizer-Werkzeuge. Ist Ihr Text nicht auf Englisch, greift das mehrsprachige Modell mit der höheren Rate von 2,4 %.
Wenn Sie AI Allowance nutzen, setzen Sie den Prozentsatz passend zu einer Richtlinie, die Sie tatsĂ€chlich niedergeschrieben haben. 0 % zu wĂ€hlen, weil es streng wirkt, wĂ€hrend Ihre reale Richtlinie KI-gestĂŒtzte Recherche toleriert, erzeugt Markierungen, die Sie anschlieĂend ignorieren â und gewöhnt Sie daran, dem Werkzeug insgesamt zu misstrauen.
An diesem Schritt entscheidet sich, ob Sie das Werkzeug verantwortlich einsetzen. Ein hoher KI-Wert bedeutet, dass der Text statistische Eigenschaften aufweist, die maschineller Erzeugung Ă€hneln. Er stellt nicht fest, wie der Text entstanden ist. Formelles Register, einfacher Wortschatz, stark ĂŒberarbeitete Prosa und nicht-muttersprachliche Wendungen treiben den Wert allesamt aus GrĂŒnden nach oben, die nichts mit KI-Nutzung zu tun haben.
Wenn das Ergebnis jemanden betreffen könnte, sammeln Sie weitere Signale: Versionshistorie, Schreibwiedergabe, eine frĂŒhere Textprobe zum Vergleich oder ein GesprĂ€ch. Das ist keine private Vorsicht meinerseits â es ist, was die Bedingungen des Anbieters von Ihnen verlangen, wie unten dargelegt.
Ein Credit entspricht 100 Wörtern. Abonnement-Credits verfallen zum Monatsende und werden nicht ĂŒbertragen; separat gekaufte Pay-as-you-go-Credits halten zwei Jahre. Bei ungleichmĂ€Ăiger Auslastung vermeidet der Pay-as-you-go-Weg, monatlich fĂŒr KapazitĂ€t zu zahlen, die verfĂ€llt.
Enterprise bietet 365 Tage Scan-Historie; Pro nennt keine entsprechende Aufbewahrung. Wenn Erkennungsergebnisse je Entscheidungen ĂŒber Menschen mitprĂ€gen, rechtfertigt allein die Möglichkeit, nachzuvollziehen, was wann gescannt wurde, den Stufenunterschied.
Abschnitt 9 der Nutzungsbedingungen untersagt es, Ausgaben als alleinige Grundlage folgenreicher Entscheidungen zu verwenden, und untersagt es, Studierende, BeschÀftigte, Auftragnehmer, Autorinnen oder Bewerber allein wegen eines Erkennungs- oder Plagiatswerts zu sanktionieren. Wer einen institutionellen Ablauf entwirft, sollte diese Klausel zur Grundlage machen. Dass ein Anbieter das niederschreibt, ist ungewöhnlich und anerkennenswert; es bindet zugleich Sie als Nutzer.
Vor einem Einsatz im MaĂstab lassen Sie eine Reihe von Texten durchlaufen, von denen Sie wissen, dass Menschen aus derselben Population sie geschrieben haben, die Sie beurteilen werden â gleiches Fachgebiet, gleicher Sprachhintergrund, gleiches Register. Ein Anbieter-Benchmark sagt nichts ĂŒber Ihr konkretes Korpus, und nur so erfahren Sie, wie Ihre eigene Falsch-Positiv-Rate aussieht.
Die eigenen Zahlen des Anbieters setzen die mehrsprachigen Falsch-Positiven auf 2,4 % gegenĂŒber 0,5 % beim englischen Lite-Modell. Wer ĂŒbersetzte oder nicht-englische Texte bewertet, sollte sein Vertrauen entsprechend anpassen.
In allen veröffentlichten Darstellungen zur Funktionsweise solcher Systeme steigt die ZuverlĂ€ssigkeit mit der LĂ€nge, einschlieĂlich OpenAIs eigenem Hinweis, dass sein Klassifikator unterhalb von 1.000 Zeichen unzuverlĂ€ssig war. Eine Markierung an einem Absatz ist nahezu bedeutungslos.
Wenn Sie Prozessbelege bekommen können, sind sie stĂ€rker als ein Wert. Eine Wiedergabe, die zeigt, wie ein Dokument ĂŒber Stunden entworfen, ĂŒberarbeitet und umgestellt wurde, ist ein positiver Beleg menschlicher Autorschaft, wie ihn kein Prozentwert liefern kann.
Eingaben der Gratisstufe können zum Training verwendet werden, und nur Bezahlkonten können widersprechen. Kundenarbeiten, unveröffentlichte Manuskripte und Einreichungen von Lernenden mit personenbezogenen Daten gehören, wenn ĂŒberhaupt, in ein Bezahlkonto.
GeprĂŒfte Bewertende berichten, dass der Abmeldeweg schwer zu Ende zu gehen ist. Wie immer Sie das bewerten, die praktische Antwort bleibt: deutlich vor einem VerlĂ€ngerungsdatum kĂŒndigen, schriftlich bestĂ€tigen lassen und den nĂ€chsten Abrechnungszyklus prĂŒfen.
Verlage, Agenturen und Content-MarktplĂ€tze passen am besten, weil die Entscheidungen, die das Werkzeug stĂŒtzt, kommerziell und nicht persönlich sind â eine Arbeit annehmen oder ablehnen â und weil Stapel- und seitenweite Scans zu ihrer Arbeitsweise passen.
Redaktionsteams mit schriftlicher KI-Richtlinie ziehen speziell aus AI Allowance echten Nutzen, da ein schwellenbasiertes Werkzeug zu einer schwellenbasierten Richtlinie passt, wie es ein binÀrer Detektor nie könnte.
Lehrende und Institutionen werden bewusst bedient â Academic-Modell, Moodle-Plugin, Schutz von SchĂŒlerdaten â sollten aber den Abschnitt zu den Grenzen vollstĂ€ndig lesen, bevor sie einen Prozess darauf aufbauen, und das Verbot des Anbieters, allein auf dieser Grundlage zu entscheiden, als Konstruktionsvorgabe und nicht als Kleingedrucktes behandeln.
Autorinnen und Autoren, die eigene Texte prĂŒfen, insbesondere wenn sie formell oder auf Englisch als Zweitsprache schreiben, haben eine wirklich defensive Verwendung.
Wer sich anderswo umsehen sollte: Wer Beweis statt Wahrscheinlichkeit sucht, findet ihn weder hier noch bei einem Wettbewerbsprodukt, weil das zugrundeliegende Problem derzeit keinen Beweis zulĂ€sst. Institutionen, die Entscheidungen ĂŒber wissenschaftliches Fehlverhalten automatisieren wollen, stehen ausdrĂŒcklich auĂerhalb dessen, was der Anbieter erlaubt. Wer ĂŒberwiegend nicht-englische Texte bewertet, sollte die höhere angegebene Falsch-Positiv-Rate sorgfĂ€ltig abwĂ€gen. Und wer keinen kleinen Anteil falscher Antworten mit realen Folgen hinnehmen kann, sollte automatisierte Erkennung ĂŒberhaupt nicht einsetzen.
Originality AI wird als Webanwendung mit Dashboard ausgeliefert und erreicht andere Umgebungen ĂŒber eine Chrome-Erweiterung (die Scans in Google Docs ausfĂŒhrt und die Schreibwiedergabe bereitstellt), ein Moodle-Plugin fĂŒr Bildungseinrichtungen, eine API fĂŒr den programmatischen Einsatz sowie Unternehmensintegrationen. Der Datei-Upload akzeptiert docx, doc und PDF, daneben eingefĂŒgten oder getippten Text, und der Website-Scan nimmt eine URL entgegen.
Der API-Zugang ist eine Funktion der Enterprise-Stufe und nicht von Pro. Kostenlose Werkzeuge â KI-PrĂŒfer, FaktenprĂŒfer, PlagiatsprĂŒfer, Lesbarkeits- und GrammatikprĂŒfer â sind als eigenstĂ€ndige Seiten auf der Website verfĂŒgbar.
Es gibt zwei veröffentlichte Abostufen, beide in US-Dollar abgerechnet, mit Rabatt bei jĂ€hrlicher gegenĂŒber monatlicher Zahlung.
Pro kostet bei Jahreszahlung 12,95 $/Monat (155,40 $ jĂ€hrlich) oder 14,95 $/Monat bei monatlicher Zahlung und richtet sich an Einzelpersonen und kleine Teams. Enthalten sind 2.000 Credits pro Monat, wobei ein Credit 100 Wörtern entspricht â also rund 200.000 Wörter monatlich. Standardsupport, Datei-Upload, vollstĂ€ndige Website-Scans, Teamverwaltung, Scan-Verschlagwortung und die Chrome-Erweiterung sind inbegriffen. ZusĂ€tzliche TeamplĂ€tze kosten 9,95 $/Monat, bei Jahreszahlung 8,62 $.
Enterprise kostet bei Jahreszahlung 136,58 $/Monat (1.638,96 $ jÀhrlich) oder 179 $/Monat monatlich und richtet sich an Agenturen und Verlage. Enthalten sind 15.000 Credits pro Monat, ein fester Customer-Success-Manager, priorisierter Support mit typischer Lösung in unter einer Stunde, 365 Tage Scan-Historie und API-Zugang. ZusÀtzliche PlÀtze kosten 24,95 $/Monat, jÀhrlich 19,04 $.
Kostenloser Zugang besteht ohne Konto: drei Scans pro Tag mit bis zu 2.000 Wörtern. So eingereichter Text kann zum Training verwendet werden, und nur Bezahlkonten können widersprechen.
Zwei Credit-Mechaniken wiegen schwerer als der Listenpreis. Abonnement-Credits verfallen zum Monatsende, wenn sie ungenutzt bleiben â sie sammeln sich nicht an. Pay-as-you-go-Credits, als Einmalzahlung erworben, verfallen zwei Jahre nach dem Kauf. Bei saisonaler oder projektbezogener Nutzung vermeidet der Pay-as-you-go-Weg, monatlich fĂŒr verdunstende KapazitĂ€t zu zahlen.
Zu RĂŒckerstattungen sind die Bedingungen direkt: Eine KĂŒndigung stoppt kĂŒnftige VerlĂ€ngerungen, erstattet aber frĂŒhere Abbuchungen nicht automatisch; GebĂŒhren sind nach Zahlung nicht erstattungsfĂ€hig, sofern Gesetz oder Bestellformular nichts anderes vorsehen; und verbrauchte Leistungen â durchgefĂŒhrte Scans, PlagiatsprĂŒfungen, API-Aufrufe â können nicht erstattet werden. Zwingende Verbraucherrechte, auf die nicht verzichtet werden kann, bleiben ausdrĂŒcklich unberĂŒhrt.
GPTZero ist im Bildungssegment der direkteste Wettbewerber und veröffentlicht eigene Genauigkeitsangaben mit demselben grundlegenden Vorbehalt â Tests des Anbieters selbst. Beide an Ihrem eigenen Korpus mit bekannter Herkunft zu vergleichen, ist aufschlussreicher als der Vergleich ihrer Werbeaussagen.
Turnitin bringt institutionelles Gewicht ĂŒber bestehende Beziehungen zu Lernplattformen und eine langjĂ€hrige Plagiatsinfrastruktur mit; an Hochschulen entscheiden Integrationspfad und Beschaffung die Frage oft, bevor die Genauigkeit ĂŒberhaupt zur Sprache kommt. Es war zudem eines der beiden kommerziellen Systeme in der unten erwĂ€hnten Weber-Wulff-Untersuchung.
Copyleaks konkurriert sowohl bei KI-Erkennung als auch bei Plagiaten mit besonderem Gewicht auf mehrsprachiger Abdeckung, was zĂ€hlen kann, wenn Ihr Korpus ĂŒberwiegend nicht englisch ist â angesichts der dort höheren angegebenen Falsch-Positiv-Raten.
Winston AI und Ă€hnliche neuere Anbieter konkurrieren ĂŒber den Preis und ĂŒber konkrete Aussagen zur Erkennung von Humanizer-Ausgaben. Dieselbe beweisbezogene Vorsicht gilt fĂŒr sie alle gleichermaĂen.
Ganz auf automatisierte Erkennung zu verzichten verdient es, als reale Option genannt zu werden. Prozessbelege â Entwurfshistorie, Versionsverwaltung, mĂŒndliche Verteidigung, Schreiben im Unterricht â fĂŒhren zu SchlĂŒssen, die sich tatsĂ€chlich verteidigen lassen, und mehrere Einrichtungen haben sich bewusst dorthin bewegt. Das ist aufwendiger und skaliert schlecht, trĂ€gt aber keine Falsch-Positiv-Rate.
Die ehrliche Zusammenfassung: In einer Kategorie, deren Kernaussagen strukturell schwer ĂŒberprĂŒfbar sind, gehört Originality AI zu den transparenteren Anbietern. Es veröffentlicht eine Modellhistorie, hat offene Benchmark-Werkzeuge herausgegeben und schreibt ausdrĂŒckliche Nutzungsgrenzen in die eigenen Bedingungen. Nichts davon löst die Grundfrage â ob irgendein Detektor genau genug fĂŒr folgenreiche Verwendung ist â und die unabhĂ€ngige Literatur legt nahe, dass die Kategorie insgesamt es nicht ist.
Das ist der zentrale Vorbehalt und er gilt ausnahmslos. Die 99 %, 99 %+, 97,8 % und die Falsch-Positiv-Raten von 0,5 % bis 2,4 % entstammen sĂ€mtlich den eigenen Tests des Unternehmens auf DatensĂ€tzen, die seine Benchmark-Tabellen als âInternal Benchmark" ausweisen. Kein unabhĂ€ngiger PrĂŒfer hat sie verifiziert. Das ist kein Vorwurf der Unredlichkeit â es ist eine Beschreibung des Beweisstatus dieser Zahlen und der Normalzustand in dieser gesamten Produktkategorie.
Auch die zugehörige Aussage gehört prĂ€zise formuliert. Die Startseite beschreibt das Produkt als âden genauesten KI-Detektor in Studien Dritter". Der eigene Genauigkeitsartikel des Unternehmens enthĂ€lt zwar eine ZwischenĂŒberschrift, die einen Ăberblick ĂŒber Studien Dritter verspricht, doch die dort prĂ€sentierten substanziellen Genauigkeitsdaten stammen aus internen Benchmarks. Wer die Studien Dritter sucht, welche die Aussage der Startseite belegen wĂŒrden, findet dort keine entsprechenden Nachweise.
Die substanziellste unabhĂ€ngige Untersuchung ist Weber-Wulff et al., âTesting of detection tools for AI-generated text", erschienen im International Journal for Educational Integrity (Bd. 19, Art. 26, 2023). Getestet wurden 12 öffentlich verfĂŒgbare Erkennungswerkzeuge sowie zwei kommerzielle Systeme; das Fazit lautet, die verfĂŒgbaren Erkennungswerkzeuge seien âweder genau noch zuverlĂ€ssig", mit einer deutlichen Neigung, KI-Inhalte fĂ€lschlich als von Menschen geschrieben einzustufen. Weiter wurde festgestellt, dass Verschleierungstechniken die Leistung der Werkzeuge erheblich verschlechtern; die Autorinnen und Autoren betonten die ernsten Implikationen eines Einsatzes solcher Systeme im akademischen Umfeld.
Diese Studie nahm Originality AI nicht gesondert ins Visier, und die getesteten Modelle liegen vor der aktuellen Generation. Sie ist aber das, was einer unabhÀngigen Bewertung der Kategorie am nÀchsten kommt, und ihr Fazit lÀsst sich mit der 99-Prozent-Aussage irgendeines Anbieters schwer vereinbaren.
Liang, Yuksekgonul, Mao, Wu und Zou von der Stanford University veröffentlichten âGPT detectors are biased against non-native English writers" (arXiv 2304.02819, eingereicht April 2023, finalisiert Juli 2023). Ihr Befund: Detektoren stufen Texte nicht-muttersprachlicher Schreibender durchgehend fĂ€lschlich als KI-erzeugt ein, wĂ€hrend sie muttersprachliche Texte korrekt einordnen. Sie zeigten zudem, dass einfaches Umformulieren per Prompt diese Verzerrung sowohl verringern als auch die Erkennung umgehen kann â ein Ergebnis, das die VerlĂ€sslichkeit der Erkennung von zwei Seiten zugleich untergrĂ€bt.
Originality AI antwortete öffentlich mit einem Beitrag unter dem Titel âEine Antwort auf eine fehlerhafte Stanford-Studie". Diese Antwort bestreitet die Methodik. Bemerkenswerterweise gibt sie zugleich die zentralen Zahlen der Studie wieder, ohne sie zu bestreiten: dass Detektoren mehr als die HĂ€lfte der TOEFL-AufsĂ€tze fĂ€lschlich als KI-erzeugt kennzeichneten, bei einer durchschnittlichen Falsch-Positiv-Rate von 61,3 %.
Leserinnen und Leser mögen aus diesem Austausch ihre eigenen SchlĂŒsse ziehen. Unstrittig ist, dass das Risiko einer Fehlklassifikation nicht-muttersprachlicher Texte ein dokumentiertes, veröffentlichtes Problem ist, dessen Existenz beide Seiten anerkennen.
Der deutlichste Hinweis darauf, wie schwer dieses Problem ist, kommt von dem Unternehmen, das die zu erkennenden Modelle baut. Die Klassifikator-Seite von OpenAI trĂ€gt den Hinweis: âSeit dem 20. Juli 2023 ist der KI-Klassifikator wegen seiner geringen Genauigkeit nicht mehr verfĂŒgbar." Die veröffentlichte Leistung: Er âidentifiziert 26 % der von KI geschriebenen Texte (Richtig-Positive) korrekt als âwahrscheinlich KI-geschrieben', wĂ€hrend er von Menschen geschriebene Texte in 9 % der FĂ€lle fĂ€lschlich als KI-geschrieben kennzeichnet".
Das ist kein Urteil ĂŒber die konkreten Modelle von Originality AI, die weit bessere Zahlen beanspruchen. Es ist der Kontext dafĂŒr, wie viel Skepsis sich diese Kategorie verdient hat.
FĂŒr alle im Bildungs- oder Personalbereich ist dies der wichtigste Punkt dieses Textes, und er stammt vom Unternehmen selbst. Abschnitt 9 der Nutzungsbedingungen untersagt Nutzenden, Ausgaben âals alleinige Grundlage fĂŒr Entscheidungen zu verwenden, die rechtliche, akademische, beschĂ€ftigungsbezogene, wohnungs-, versicherungs-, kredit-, disziplinar-, reputations-, medizinische oder vergleichbar erhebliche Auswirkungen auf eine Person haben können", und insbesondere, eine Person âallein aufgrund einer KI-Erkennungsausgabe oder eines Plagiatswerts zu beschuldigen, zu disziplinieren, zu bestrafen, zu kĂŒndigen, durchfallen zu lassen, zu melden oder anderweitig erheblich zu benachteiligen". Abschnitt 8 verlangt, âvor jeder MaĂnahme, die eine Person erheblich betreffen kann, menschliche PrĂŒfung und ein angemessenes ordnungsgemĂ€Ăes Verfahren einzusetzen".
Schlicht gelesen: Der Anbieter bewirbt den genauesten verfĂŒgbaren Detektor und untersagt Ihnen zugleich, dessen Ausgabe als hinreichenden Grund zu behandeln, eine Studierende durchfallen zu lassen oder eine Mitarbeiterin zu entlassen. Beide Positionen sind vertretbar, und sie zusammen zu halten ist ehrlicher als das, was die meisten Wettbewerber leisten. Doch eine Einrichtung, die dieses Werkzeug einsetzt, um Fehlverhaltensbefunde zu automatisieren, verstöĂt gegen die Bedingungen, denen sie zugestimmt hat.
Nimmt man die Zahlen des Unternehmens fĂŒr bare MĂŒnze, zĂ€hlt die Arithmetik weiterhin. Bei der angegebenen Falsch-Positiv-Rate des Academic-Modells von unter 1 % könnten beim Scannen von tausend tatsĂ€chlich von Menschen geschriebenen Arbeiten immer noch knapp zehn markiert werden. Bei den 2,4 % des mehrsprachigen Modells fĂ€llt die absolute Zahl noch höher aus. Prozentwerte, die im Marketing beruhigend wirken, beschreiben eine erhebliche Zahl einzelner Menschen, sobald man sie auf einen ganzen Jahrgang anwendet.
Das Trustpilot-Profil weist 4,6 ĂŒber 1.294 Bewertungen aus â eine groĂe Stichprobe â verteilt auf 80 % fĂŒnf Sterne, 6 % vier, 1 % drei, 1 % zwei und 12 % einen Stern.
Zwei EinschrĂ€nkungen. Das Profil ist seit September 2023 vom Anbieter beansprucht, Trustpilot vermerkt, dass das Unternehmen aktiv um Bewertungen bittet, und der Anbieter hat auf 89 % der negativen Bewertungen geantwortet â all das erzeugt Auswahldruck in positive Richtung. Substanzieller noch: Beim Lesen der jĂŒngeren positiven Bewertungen zeigt sich, dass sie stark auf den Kundenservice entfallen â wiederholt werden einzelne Support-Mitarbeitende namentlich genannt â und nicht auf die Erkennungsgenauigkeit. Die 4,6 liest man am besten als Signal zur ReaktionsfĂ€higkeit des Unternehmens, nicht als BestĂ€tigung der Richtigkeit des Detektors durch Nutzende.
Auf der negativen Seite kehrt eine konkrete Beschwerde zur KĂŒndigung wieder. Ein geprĂŒfter Bewertender beschreibt den Abmeldelink als âextrem winzig, gut versteckt und in einer nahezu vollstĂ€ndig transparenten Schrift", gefolgt von etwa acht Halteangeboten, und gibt an, dass die Wahl, Feedback abzugeben, den Abschluss der KĂŒndigung buchstĂ€blich unmöglich machte und das Konto stattdessen pausiert wurde.
Abonnement-Credits werden nicht ĂŒbertragen â ungenutzte KapazitĂ€t verfĂ€llt zum Monatsende. Eine KĂŒndigung stoppt kĂŒnftige VerlĂ€ngerungen, erstattet frĂŒhere Abbuchungen aber nicht, und verbrauchte Scans sowie API-Aufrufe sind nicht erstattungsfĂ€hig. Bei ungleichmĂ€Ăiger Auslastung passt die Pay-as-you-go-Option mit zweijĂ€hriger GĂŒltigkeit strukturell besser.
Die Bedingungen untersagen Reverse Engineering, Dekompilieren oder den Versuch, Quellcode, Algorithmen, Modellgewichte, Prompts, Systemdesign oder nicht öffentliche Benchmarks abzuleiten. Das ist ein ĂŒblicher kommerzieller Schutz, bedeutet aber in Verbindung mit intern erzeugten Genauigkeitswerten, dass die zentralen Aussagen des Produkts konstruktionsbedingt von auĂen nicht ĂŒberprĂŒfbar sind.
Die eigene Modellhistorie des Anbieters zeigt, wie die Genauigkeit auf dem schwierigsten Testsatz in einer Version von 90,2 % auf 98,8 % stieg, wĂ€hrend sich die Falsch-Positiven im selben Schritt nur marginal von 2,9 % auf 2,8 % verbesserten. Diese Kurve spiegelt ein bewegliches Ziel: Humanizer- und Bypasser-Werkzeuge entwickeln sich parallel zu den Detektoren, und eine heute veröffentlichte Zahl beschreibt die Leistung gegenĂŒber jenen Umgehungstechniken, die zum Zeitpunkt des Tests existierten.
Das Unternehmen nennt 99 % oder besser fĂŒr seine aktuellen englischen Modelle, mit Falsch-Positiv-Raten zwischen 0,5 % und unter 1 %, sowie 97,8 % insgesamt fĂŒr sein 30-sprachiges Modell bei 2,4 % Falsch-Positiven. Alle diese Werte stammen aus eigenen Tests des Unternehmens auf DatensĂ€tzen mit der Kennzeichnung âInternal Benchmark", und keiner wurde unabhĂ€ngig geprĂŒft. UnabhĂ€ngige begutachtete Arbeiten zu Erkennungswerkzeugen als Kategorie â allen voran Weber-Wulff et al. 2023 â kamen zu dem Schluss, dass verfĂŒgbare Werkzeuge âweder genau noch zuverlĂ€ssig" sind. Behandeln Sie die Anbieterzahlen als Behauptungen, nicht als Messungen.
Ja, und der Anbieter legt die Raten dafĂŒr selbst offen. Wichtiger noch: Veröffentlichte Forschung dokumentiert, dass das Risiko ungleich verteilt ist. Eine Stanford-Studie fand, dass Detektoren nicht-muttersprachliche englische Texte weit hĂ€ufiger fĂ€lschlich als KI-erzeugt einstufen als muttersprachliche, mit einer durchschnittlichen Falsch-Positiv-Rate von 61,3 % bei TOEFL-AufsĂ€tzen. Originality AI bestreitet die Methodik dieser Studie und gibt ihre Zahlen zugleich wieder. Formelles Register, einfacher Wortschatz und starke Ăberarbeitung treiben den Wert allesamt aus GrĂŒnden nach oben, die nichts mit KI zu tun haben.
Nicht allein damit â und das ist die Regel des Anbieters, nicht bloĂ ein Ratschlag. Die Nutzungsbedingungen untersagen es, Ausgaben als alleinige Grundlage fĂŒr Entscheidungen mit akademischen, beschĂ€ftigungsbezogenen oder disziplinarischen Folgen zu verwenden, und untersagen insbesondere, Studierende, BeschĂ€ftigte, Auftragnehmer, Autorinnen oder Bewerber allein wegen eines Erkennungs- oder Plagiatswerts zu sanktionieren. Sie verlangen zudem menschliche PrĂŒfung und ein angemessenes Verfahren vor jeder MaĂnahme, die eine Person erheblich betreffen kann.
Pro kostet 12,95 $/Monat bei Jahreszahlung oder 14,95 $ monatlich, mit 2.000 Credits pro Monat. Enterprise kostet 136,58 $/Monat bei Jahreszahlung oder 179 $ monatlich, mit 15.000 Credits, API-Zugang, 365 Tagen Scan-Historie und priorisiertem Support. Ein Credit entspricht 100 Wörtern. ZusÀtzliche PlÀtze kosten in beiden Stufen extra. Es gibt einen kostenlosen Zugang mit drei Scans pro Tag bis 2.000 Wörter, ohne Konto.
Ja â drei Scans tĂ€glich mit bis zu 2.000 Wörtern, ohne Konto. Der Haken ist, dass in den kostenlosen Detektor eingegebener Text zum Training verwendet werden kann und nur Bezahlkonten widersprechen können. Nutzen Sie ihn nicht fĂŒr vertrauliches oder Kundenmaterial.
Bei Abonnements nicht. Abonnement-Credits verfallen zum Monatsende, wenn sie ungenutzt bleiben. Separat gekaufte Pay-as-you-go-Credits verfallen zwei Jahre nach dem Kaufdatum, was zu unregelmĂ€Ăiger Auslastung besser passt.
Ja, ĂŒber ein mehrsprachiges Modell mit 30 Sprachen und einer vom Anbieter angegebenen Gesamtgenauigkeit von 97,8 %. Beachten Sie, dass dieselbe Offenlegung dessen Falsch-Positiv-Rate mit 2,4 % angibt, gegenĂŒber 0,5 % beim englischen Lite-Modell â nach den eigenen Zahlen des Anbieters deutlich höher.
Der Anbieter gibt an, Turbo 3.0.2 erkenne humanisierte Inhalte mit bis zu 97 % Genauigkeit und Academic 0.0.5 sei gegen Humanizer- und Bypasser-Werkzeuge mit bis zu 92 % robust. Das sind interne Zahlen. Da Erkennung und Umgehung sich gemeinsam entwickeln, beschreibt eine solche Zahl die Leistung gegenĂŒber den Umgehungstechniken, die zum Testzeitpunkt verfĂŒgbar waren.
Die Trustpilot-Verteilung liegt bei 4,6 ĂŒber 1.294 Bewertungen, mit 80 % fĂŒnf Sternen und 12 % einem Stern. Positive Bewertungen konzentrieren sich auf den Kundenservice statt auf die Erkennungsgenauigkeit. Das wiederkehrende negative Thema ist die Schwierigkeit der KĂŒndigung â ein geprĂŒfter Bewertender beschreibt einen nahezu unsichtbaren Abmeldelink, etwa acht Halteangebote und die Unmöglichkeit, die KĂŒndigung nach der Wahl, Feedback abzugeben, abzuschlieĂen.
Nein, und kein Wettbewerber ebenso wenig. Ein Erkennungswert ist eine statistische Wahrscheinlichkeit, kein Beleg dafĂŒr, wie ein Text entstanden ist. Das AussagekrĂ€ftigste am Produkt ist nicht der Wert, sondern die Schreibwiedergabe in der Chrome-Erweiterung, die festhĂ€lt, wie ein Dokument tatsĂ€chlich verfasst wurde. Ein solcher Prozessbeleg ist weit stĂ€rker als jeder Prozentwert â und es ist die Richtung, in die sich die belastbarste Praxis wissenschaftlicher IntegritĂ€t ohnehin bewegt hat.