¿Has usado esta herramienta? Valórala
¿Has usado esta herramienta? Valórala
Originality AI es un servicio de verificación de textos basado en web, operado por Originality AI Inc, empresa canadiense registrada en el 64 de Hurontario St, en Collingwood, Ontario. Recibe un texto y devuelve dos juicios principales: una puntuación que indica la probabilidad de que haya sido generado por un modelo de IA, y una comprobación de plagio frente a material ya publicado. Alrededor de estos se sitúan comprobaciones secundarias: gramática, legibilidad, verificación de hechos, puntuación de calidad del contenido y cumplimiento de directrices.
La empresa fue fundada por Jon Gillham tras vender una agencia de marketing de contenidos que él mismo había creado, y el servicio se lanzó en noviembre de 2022; cabe destacar que fue antes del lanzamiento público de ChatGPT, cuando estaba construido para detectar salidas de GPT-3. En esa anterioridad se apoya su afirmación de haber sido el primer detector de IA disponible comercialmente.
Todo lo demás en este artículo depende de una distinción, así que conviene plantearla de entrada. La página de inicio describe el producto como «el detector de IA más preciso en estudios de terceros». Sin embargo, las cifras de precisión que publica la empresa —99 %, 99 %+, 97,8 % y tasas de falsos positivos de entre 0,5 % y 2,4 %— proceden de conjuntos de datos que sus propias tablas de referencia etiquetan como «Internal Benchmark». Son pruebas realizadas por el proveedor sobre datos elegidos por el proveedor, y ninguna ha sido auditada de forma independiente. Mientras tanto, la literatura revisada por pares que existe sobre este problema llega a una conclusión marcadamente distinta sobre las herramientas de detección como categoría. Ambas caras se exponen más abajo, porque quien deba decidir si confía en esta herramienta necesita las dos.
Hay tres modelos vigentes, publicados en septiembre de 2025, y el proveedor da una cifra concreta para cada uno. Lite 1.0.2 se declara con un 99 % de precisión sobre los principales modelos de referencia —OpenAI, Gemini, Claude y DeepSeek— con una tasa de falsos positivos del 0,5 %. Turbo 3.0.2 se declara con 99 %+ sobre esos mismos modelos, con hasta un 97 % de precisión en contenido «humanizado» y una tasa de falsos positivos del 1,5 %. Academic 0.0.5 se declara con 99 %+ y menos del 1 % de falsos positivos, orientado a material académico incluidas respuestas científicas, código y fórmulas, y con hasta un 92 % de precisión frente a herramientas de humanización y elusión.
Estas son las cifras sobre las que descansa el discurso comercial, y merecen leerse junto a la fuente que el propio proveedor les atribuye. La tabla publicada sitúa a Lite 1.0.2 en un 98,91 % de verdaderos positivos, 0,52 % de falsos positivos y 1,09 % de falsos negativos, frente a un conjunto de datos que el encabezado de columna del proveedor denomina «Internal Benchmark: Recently Released Models».
Introducida en junio de 2026, AI Allowance rompe con la pregunta binaria que todo detector había planteado hasta ahora. En lugar de «¿esto es IA o no?», usted fija cuánta intervención de IA está dispuesto a aceptar —0 %, 5 %, 15 %, 25 % o 40 %— y la herramienta puntúa respecto a ese umbral. El proveedor afirma un 99 %+ de precisión con el ajuste predeterminado del 15 %.
Conceptualmente es lo más interesante del producto, porque reconoce lo que el marco binario oculta: en 2026 la mayoría de los textos reales se sitúan en un continuo entre lo enteramente humano y lo enteramente automático, y una política editorial suele importarle el grado, no la mera presencia. Que la medición subyacente sostenga de hecho esa distinción más fina lo atestiguan, de nuevo, solo pruebas internas.
El modelo Multilingual 2.0.0, publicado en mayo de 2025, cubre 30 idiomas con una precisión global declarada del 97,8 %, falsos negativos reducidos al 1,99 % y una tasa de falsos positivos del 2,4 %.
Esta última cifra merece atención, porque es la propia divulgación del proveedor de que la detección fuera del inglés es mediblemente más débil: 2,4 % de falsos positivos frente al 0,5 % de Lite y menos del 1 % de Academic. Quien evalúe textos en un idioma distinto del inglés trabaja, según las cifras de la propia empresa, con aproximadamente entre dos y cinco veces la tasa de falsos positivos de los modelos en inglés.
La detección de plagio es una línea de producto equiparable y no un añadido: entre los motivos declarados del fundador figuraba construir un comprobador de plagio moderno con historial de análisis, resultados compartibles y acceso en equipo. Alrededor de estos dos pilares se sitúan el verificador de hechos, el corrector gramatical, el analizador de legibilidad, la puntuación de calidad del contenido y el comprobador de directrices, además de Bulk Scan para volumen y los análisis de sitio completo a partir de una URL.
La extensión de Chrome ejecuta análisis directamente dentro de Google Docs y puede reproducir el proceso de escritura, mostrando cómo se compuso un documento a lo largo del tiempo en lugar de juzgar solo el texto acabado. Es una clase de evidencia distinta de una puntuación: evidencia de proceso en vez de inferencia estadística, y considerablemente más difícil de falsificar. Para un docente que intenta establecer si un estudiante escribió algo, una reproducción que muestre una redacción orgánica es más informativa que cualquier porcentaje.
En transparencia la empresa ha hecho más que la mayoría de sus competidores: en agosto de 2023 publicó un conjunto de datos de referencia de código abierto y herramientas abiertas de comprobación de eficacia. En una categoría donde casi ningún proveedor publica nada, es un paso genuino e inusual.
Debe sopesarse con dos hechos contrarios. Las cifras de precisión de los modelos insignia actuales siguen procediendo de referencias internas y no de ese conjunto abierto, y las condiciones prohíben la ingeniería inversa, la descompilación o cualquier intento de derivar los modelos, pesos, indicaciones o referencias no públicas, lo que significa que terceros no pueden verificar de forma independiente cómo llega el sistema actual a sus conclusiones.
El nivel Enterprise se posiciona explícitamente para agencias y editoriales, y es el uso donde las limitaciones de la herramienta pesan menos. Cuando un editor comprueba si un colaborador entregó lo encargado, una puntuación de detección es un insumo de conversación, no un veredicto con consecuencias. El análisis por lotes y el de sitio completo lo hacen practicable a escala.
AI Allowance encaja con organizaciones que realmente han redactado una política —«la asistencia de IA es aceptable para documentarse y esbozar, pero la redacción debe ser suya»— en lugar de una prohibición general. Fijar un umbral que corresponda a la política es más honesto que fingir que un detector binario puede hacer cumplir una regla matizada.
El modelo Academic, el plugin de Moodle y las disposiciones sobre datos del alumnado muestran que este segmento se atiende deliberadamente. Pero es también donde las propias condiciones de la herramienta imponen los límites más nítidos, tratados más abajo. Empleada como una señal entre varias —junto a una reproducción de escritura, un historial de borradores o una conversación con el estudiante— puede aportar. Empleada como factor decisivo, infringe la política de uso aceptable del propio proveedor.
Quien encarga contenidos, evalúa una colaboración o valora si las reseñas de producto son auténticas tiene aquí una necesidad legítima, y las consecuencias de un falso positivo son proporcionadas: se rechaza un envío en lugar de sancionar a una persona.
Un uso a menudo pasado por alto: quienes escriben en un registro formal y estructurado —lo que describe a muchísimos autores no nativos de inglés, redactores técnicos y académicos— pueden comprobar si su prosa corre riesgo de ser marcada, y saber de antemano que quizá deban dar explicaciones. Es un uso defensivo que sus críticos rara vez mencionan.
Sin cuenta hay tres análisis diarios de hasta 2.000 palabras. Úselos con textos cuyo origen ya conoce con certeza: algo escrito por usted y algo que sepa que se generó automáticamente, para calibrar sus expectativas antes de gastar dinero.
Tenga en cuenta la contrapartida: el texto introducido en el detector gratuito puede usarse para entrenamiento. Excluirse requiere una cuenta de pago. No pegue material confidencial o de clientes en la herramienta gratuita.
Lite, Turbo y Academic no son intercambiables. Academic está construido para respuestas científicas, código y fórmulas, y declara la tasa de falsos positivos más baja. Turbo es la opción más robusta frente a herramientas de humanización. Si su texto no está en inglés, se aplica el modelo multilingüe con su tasa más alta del 2,4 %.
Si usa AI Allowance, ajuste el porcentaje a una política que haya escrito de verdad. Elegir 0 % porque parece riguroso, cuando su política real tolera documentarse con IA, produce marcas que luego ignorará, y eso le entrena para desconfiar de la herramienta por completo.
Este paso determina si usa la herramienta de forma responsable. Una puntuación alta de IA significa que el texto presenta propiedades estadísticas parecidas a la generación automática. No establece cómo se produjo el texto. Registro formal, vocabulario sencillo, prosa muy editada y giros no nativos empujan la puntuación al alza por razones ajenas al uso de IA.
Si el resultado puede afectar a alguien, reúna otras señales: historial de versiones, reproducción de escritura, una muestra de texto anterior para comparar, o una conversación. No es cautela mía: es lo que las condiciones del proveedor le exigen, como se expone más abajo.
Un crédito equivale a 100 palabras. Los créditos de suscripción caducan al final de cada mes y no se acumulan; los créditos de pago por uso comprados aparte duran dos años. Si su carga es irregular, la vía de pago por uso evita pagar cada mes por capacidad que se pierde.
Enterprise ofrece 365 días de historial de análisis; Pro no especifica una retención equivalente. Si los resultados de detección pueden llegar a informar decisiones sobre personas, la sola posibilidad de revisar qué se analizó y cuándo justifica la diferencia de nivel.
La sección 9 de las condiciones prohíbe usar la salida como base única de decisiones de consecuencia y prohíbe sancionar a un estudiante, empleado, contratista, redactor o candidato únicamente por una puntuación de detección o plagio. Si está diseñando un flujo institucional, esa cláusula debe darle forma. Que un proveedor lo ponga por escrito es inusual y meritorio; también le obliga a usted como usuario.
Antes de desplegar a escala, pase un conjunto de textos que sepa escritos por humanos de la misma población que evaluará: misma materia, mismo trasfondo lingüístico, mismo registro. La referencia de un proveedor no dice nada sobre su corpus concreto, y esta es la única manera de conocer su propia tasa de falsos positivos.
Las propias cifras del proveedor sitúan los falsos positivos multilingües en 2,4 % frente al 0,5 % del modelo inglés Lite. Si evalúa textos traducidos o no ingleses, ajuste su confianza en consecuencia.
En todos los relatos publicados sobre cómo funcionan estos sistemas la fiabilidad crece con la longitud, incluida la nota de la propia OpenAI de que su clasificador no era fiable por debajo de 1.000 caracteres. Una marca sobre un párrafo carece casi por completo de significado.
Si puede obtener evidencia de proceso, es más fuerte que una puntuación. Una reproducción que muestre un documento redactado, revisado y reestructurado a lo largo de horas es evidencia positiva de autoría humana como ningún porcentaje puede serlo.
Lo introducido en el nivel gratuito puede usarse para entrenamiento, y solo las cuentas de pago pueden excluirse. Trabajos de clientes, manuscritos inéditos y entregas de alumnado con datos personales solo tienen cabida, si acaso, en una cuenta de pago.
Reseñadores verificados informan de que la vía de baja resulta difícil de completar. Sea cual sea su lectura, la respuesta práctica es la misma: cancelar bastante antes de una fecha de renovación, obtener confirmación por escrito y revisar el siguiente ciclo de facturación.
Editoriales, agencias y mercados de contenido encajan mejor, porque las decisiones que la herramienta informa son comerciales y no personales —aceptar o rechazar un trabajo— y el instrumental de análisis por lotes y de sitio completo se ajusta a su forma de operar.
Equipos editoriales con una política de IA escrita obtienen valor real específicamente de AI Allowance, ya que una herramienta basada en umbrales encaja con una política basada en umbrales de un modo que un detector binario nunca podría.
Docentes e instituciones están atendidos deliberadamente —modelo Academic, plugin de Moodle, protecciones de datos del alumnado— pero deberían leer completa la sección de limitaciones antes de construir cualquier proceso, y tratar la prohibición del propio proveedor de decidir solo con esta base como una restricción de diseño y no como letra pequeña.
Autores que revisan su propio trabajo, en particular quienes escriben en registro formal o en inglés como lengua adicional, tienen un uso genuinamente defensivo.
Quién debería mirar en otra parte: quien busque prueba en lugar de probabilidad no la encontrará aquí ni en ningún producto competidor, porque el problema de fondo no admite prueba por ahora. Las instituciones que quieran automatizar decisiones sobre fraude académico quedan explícitamente fuera de lo que el proveedor permite. Quien evalúe principalmente textos no ingleses debería sopesar con cuidado la tasa de falsos positivos declarada más alta. Y quien no pueda tolerar un pequeño porcentaje de respuestas erróneas con consecuencias reales no debería usar detección automatizada en absoluto.
Originality AI se entrega como aplicación web con panel de control, y alcanza otros entornos mediante una extensión de Chrome (que ejecuta análisis en Google Docs y ofrece la reproducción de escritura), un plugin de Moodle para centros educativos, una API para uso programático e integraciones empresariales. La carga de archivos admite docx, doc y PDF, además de texto pegado o escrito, y el análisis de sitio acepta una URL.
El acceso a la API corresponde al nivel Enterprise y no a Pro. Las herramientas gratuitas —verificador de IA, verificador de hechos, comprobador de plagio, analizadores de legibilidad y gramática— se exponen como páginas independientes en el sitio.
Hay dos niveles de suscripción publicados, ambos facturados en dólares estadounidenses, con descuento anual frente al mensual.
Pro cuesta 12,95 $/mes con facturación anual (155,40 $ al año) o 14,95 $/mes con facturación mensual, orientado a particulares y equipos pequeños. Incluye 2.000 créditos al mes, donde un crédito equivale a 100 palabras: unas 200.000 palabras analizadas mensualmente. Incluye soporte estándar, carga de archivos, análisis de sitio completo, gestión de equipo, etiquetado de análisis y la extensión de Chrome. Los puestos adicionales cuestan 9,95 $/mes, u 8,62 $ en facturación anual.
Enterprise cuesta 136,58 $/mes con facturación anual (1.638,96 $ al año) o 179 $/mes mensual, orientado a agencias y editoriales. Incluye 15.000 créditos al mes, un gestor de éxito del cliente dedicado, soporte prioritario con resolución típica en menos de una hora, 365 días de historial de análisis y acceso a la API. Los puestos adicionales cuestan 24,95 $/mes, o 19,04 $ anuales.
El acceso gratuito existe sin cuenta: tres análisis diarios de hasta 2.000 palabras. El texto así enviado puede usarse para entrenamiento, y solo las cuentas de pago pueden excluirse.
Dos mecánicas de créditos importan más que el precio de catálogo. Los créditos de suscripción caducan al final de cada mes si no se usan: no se acumulan. Los créditos de pago por uso, adquiridos en un pago único, caducan dos años después de la compra. Si su actividad es estacional o por proyectos, la vía de pago por uso evita pagar cada mes por capacidad que se evapora.
Sobre reembolsos, las condiciones son directas: la cancelación detiene renovaciones futuras pero no reembolsa automáticamente cargos anteriores; las tarifas no son reembolsables una vez pagadas salvo que la ley o un formulario de pedido dispongan otra cosa; y los servicios consumidos —análisis completados, comprobaciones de plagio, llamadas a la API— no pueden reembolsarse. Las condiciones sí preservan los derechos imperativos del consumidor que no pueden renunciarse.
GPTZero es el competidor más directo en el segmento educativo y publica sus propias afirmaciones de precisión con la misma salvedad fundamental: pruebas realizadas por el propio proveedor. Comparar ambos con su propio corpus de procedencia conocida es más informativo que comparar sus mensajes comerciales.
Turnitin aporta peso institucional gracias a sus relaciones existentes con sistemas de gestión del aprendizaje y a una infraestructura de plagio de largo recorrido; en universidades, la vía de integración y el proceso de compra suelen resolver la cuestión antes que la precisión. Fue además uno de los dos sistemas comerciales incluidos en la evaluación de Weber-Wulff comentada más abajo.
Copyleaks compite en detección de IA y plagio con especial énfasis en la cobertura multilingüe, lo que puede importar si su corpus es mayoritariamente no inglés, dadas las tasas de falsos positivos declaradas más altas en ese contexto.
Winston AI y otros entrantes más recientes compiten en precio y con afirmaciones concretas sobre la detección de salidas de herramientas de humanización. La misma cautela probatoria se aplica por igual a todos ellos.
Prescindir de la detección automatizada merece figurar como opción real. La evidencia de proceso —historial de borradores, control de versiones, defensa oral, escritura en clase— produce conclusiones que sí se pueden defender, y varias instituciones se han movido deliberadamente en esa dirección. Da más trabajo y escala mal, pero no lleva aparejada una tasa de falsos positivos.
El resumen honesto: en una categoría cuyas afirmaciones centrales son estructuralmente difíciles de verificar, Originality AI está entre los proveedores más transparentes. Publica un historial de modelos, ha difundido herramientas de referencia abiertas y escribe límites de uso explícitos en sus propias condiciones. Nada de eso resuelve la cuestión de fondo —si algún detector es lo bastante preciso para un uso con consecuencias— y la literatura independiente sugiere que la categoría en su conjunto no lo es.
Esta es la salvedad central y se aplica sin excepción. El 99 %, el 99 %+, el 97,8 % y las tasas de falsos positivos del 0,5 % al 2,4 % proceden todos de pruebas de la propia empresa sobre conjuntos de datos que sus tablas etiquetan como «Internal Benchmark». Ningún auditor independiente los ha verificado. No es una acusación de mala fe: es una descripción del estatus probatorio de esas cifras, y es el estado normal de las cosas en toda esta categoría.
La afirmación asociada también requiere precisión. La página de inicio describe el producto como «el detector de IA más preciso en estudios de terceros». El artículo de la empresa sobre precisión contiene un epígrafe que promete un panorama de estudios de terceros, pero los datos sustantivos de precisión presentados en esa página proceden de referencias internas. Quien busque los estudios de terceros que respaldarían la frase de la portada no encontrará allí las citas correspondientes.
La evaluación independiente más sustancial es la de Weber-Wulff y colegas, «Testing of detection tools for AI-generated text», publicada en el International Journal for Educational Integrity (vol. 19, art. 26, 2023). Probó 12 herramientas de detección disponibles públicamente más dos sistemas comerciales, y concluyó que las herramientas de detección disponibles «no son ni precisas ni fiables», con un sesgo significativo hacia clasificar erróneamente contenido de IA como escrito por humanos. Halló además que las técnicas de ofuscación empeoran significativamente el rendimiento de las herramientas, y los autores subrayaron las serias implicaciones de usar tales sistemas en contextos académicos.
Este estudio no señalaba específicamente a Originality AI, y los modelos evaluados son anteriores a la generación actual. Pero es lo más parecido a una evaluación independiente de la categoría que existe, y su conclusión resulta difícil de conciliar con la afirmación del 99 % de cualquier proveedor.
Liang, Yuksekgonul, Mao, Wu y Zou, de Stanford, publicaron «GPT detectors are biased against non-native English writers» (arXiv 2304.02819, presentado en abril de 2023, versión final en julio de 2023). Su hallazgo: los detectores clasifican sistemáticamente de forma errónea la escritura no nativa en inglés como generada por IA, mientras clasifican correctamente la escritura nativa. Mostraron además que una simple reformulación mediante indicaciones puede tanto reducir ese sesgo como eludir la detección, un resultado que socava la fiabilidad de la detección por ambos lados.
Originality AI respondió públicamente con un artículo titulado «Una respuesta a un estudio defectuoso de Stanford». La respuesta cuestiona la metodología. Cabe destacar que también reproduce las cifras centrales del estudio sin discutirlas: que los detectores etiquetaron erróneamente más de la mitad de los ensayos TOEFL como generados por IA, con una tasa media de falsos positivos del 61,3 %.
Cada lector extraerá su conclusión de ese intercambio. Lo que no está en disputa es que el riesgo de clasificar mal la escritura no nativa es una preocupación documentada y publicada cuya existencia ambas partes reconocen.
La indicación más clara de la dificultad del problema procede de la empresa que construye los modelos que se pretende detectar. La página del clasificador de OpenAI lleva esta nota: «Desde el 20 de julio de 2023, el clasificador de IA ya no está disponible debido a su baja tasa de precisión». Su rendimiento publicado: «identifica correctamente el 26 % del texto escrito por IA (verdaderos positivos) como "probablemente escrito por IA", mientras etiqueta erróneamente texto escrito por humanos como escrito por IA el 9 % de las veces».
No es un comentario sobre los modelos concretos de Originality AI, que declaran cifras muy superiores. Es el contexto de cuánto escepticismo se ha ganado esta categoría.
Para cualquiera en educación o recursos humanos, esto es lo más importante del artículo, y procede de la propia empresa. La sección 9 de las condiciones prohíbe a los usuarios emplear la salida «como base única de decisiones que puedan tener efectos legales, académicos, laborales, de vivienda, seguros, crédito, disciplinarios, reputacionales, médicos o de importancia comparable sobre una persona», y específicamente «acusar, sancionar, penalizar, despedir, suspender, denunciar o perjudicar materialmente de otro modo a un estudiante, empleado, contratista, redactor, candidato u otra persona únicamente a causa de una salida de detección de IA o una puntuación de plagio». La sección 8 exige «emplear revisión humana y el debido proceso apropiado antes de emprender cualquier acción que pueda afectar materialmente a una persona».
Leído sin rodeos: el proveedor comercializa el detector más preciso disponible y al mismo tiempo le prohíbe tratar su salida como motivo suficiente para suspender a un estudiante o despedir a un empleado. Ambas posiciones son defendibles, y sostenerlas juntas es más honesto de lo que logran la mayoría de competidores. Pero una institución que adopte esta herramienta para automatizar dictámenes de fraude está infringiendo las condiciones que aceptó.
Aun tomando las cifras de la empresa al pie de la letra, la aritmética sigue importando. Con la tasa declarada de menos del 1 % de falsos positivos del modelo Academic, analizar mil trabajos realmente escritos por humanos aún podría marcar cerca de diez. Con el 2,4 % del modelo multilingüe, la cifra absoluta es todavía mayor. Porcentajes que resultan tranquilizadores en un folleto describen un número sustancial de personas concretas cuando se aplican a una promoción entera.
El perfil de Trustpilot muestra un 4,6 sobre 1.294 reseñas —una muestra grande— repartido en 80 % de cinco estrellas, 6 % de cuatro, 1 % de tres, 1 % de dos y 12 % de una estrella.
Dos matices. El perfil está reclamado por el proveedor desde septiembre de 2023, Trustpilot indica que la empresa invita activamente a valorar y el proveedor ha respondido al 89 % de las reseñas negativas: todo ello introduce presión de selección hacia lo positivo. Más sustancialmente, la lectura de las reseñas positivas recientes muestra que se concentran de forma marcada en la atención al cliente, nombrando repetidamente a miembros concretos del soporte, y no en la exactitud de la detección. El 4,6 se lee mejor como señal sobre la capacidad de respuesta de la empresa que como validación por los usuarios de la corrección del detector.
En el lado negativo se repite una queja concreta sobre la cancelación. Un reseñador verificado describe el enlace de baja como «extremadamente diminuto, bien escondido y en una tipografía casi enteramente transparente», seguido de unas ocho ofertas de retención, e indica que elegir dejar comentarios hacía literalmente imposible completar la cancelación, quedando la cuenta en pausa.
Los créditos de suscripción no se transfieren: la capacidad no usada desaparece a fin de mes. La cancelación detiene renovaciones futuras pero no reembolsa cargos anteriores, y los análisis y llamadas a la API consumidos no son reembolsables. Para cargas irregulares, la opción de pago por uso, válida dos años, encaja estructuralmente mejor.
Las condiciones prohíben la ingeniería inversa, la descompilación o el intento de derivar código fuente, algoritmos, pesos del modelo, indicaciones, diseño del sistema o referencias no públicas. Es una protección comercial estándar, pero combinada con cifras de precisión generadas internamente significa que las afirmaciones centrales del producto no son verificables desde fuera por diseño.
El propio historial de modelos del proveedor muestra la precisión en su conjunto de prueba más difícil pasando del 90,2 % al 98,8 % en una versión, mientras los falsos positivos mejoraban solo marginalmente, del 2,9 % al 2,8 %, en ese mismo paso. Esa trayectoria refleja un blanco móvil: las herramientas de humanización y elusión evolucionan a la par que los detectores, y una cifra publicada hoy describe el rendimiento frente a las técnicas de evasión que existían cuando se realizó la prueba.
La empresa declara un 99 % o más para sus modelos actuales en inglés, con tasas de falsos positivos entre 0,5 % y menos del 1 %, y un 97,8 % global para su modelo multilingüe de 30 idiomas con un 2,4 % de falsos positivos. Todas estas cifras proceden de pruebas de la propia empresa sobre conjuntos etiquetados como «Internal Benchmark», y ninguna ha sido auditada de forma independiente. El trabajo independiente revisado por pares sobre las herramientas de detección como categoría —sobre todo Weber-Wulff y colegas, 2023— concluyó que las herramientas disponibles «no son ni precisas ni fiables». Trate las cifras del proveedor como afirmaciones, no como mediciones.
Sí, y el proveedor publica directamente esas tasas. Más importante aún, la investigación publicada documenta que el riesgo no se distribuye por igual: un estudio de Stanford halló que los detectores clasifican erróneamente la escritura no nativa en inglés como generada por IA mucho más a menudo que la nativa, con una tasa media de falsos positivos del 61,3 % en ensayos TOEFL. Originality AI cuestiona la metodología de ese estudio a la vez que reproduce sus cifras. Registro formal, vocabulario sencillo y edición intensa elevan la puntuación por razones ajenas a la IA.
No por sí solo, y esta es la regla del propio proveedor, no un mero consejo. Las condiciones prohíben usar la salida como base única de decisiones con consecuencias académicas, laborales o disciplinarias, y prohíben específicamente sancionar a un estudiante, empleado, contratista, redactor o candidato únicamente por una puntuación de detección o plagio. También exigen revisión humana y debido proceso antes de cualquier acción que pueda afectar materialmente a una persona.
Pro cuesta 12,95 $/mes con facturación anual o 14,95 $ mensual, con 2.000 créditos al mes. Enterprise cuesta 136,58 $/mes anual o 179 $ mensual, con 15.000 créditos, acceso a la API, 365 días de historial y soporte prioritario. Un crédito equivale a 100 palabras. Los puestos adicionales se cobran aparte en ambos niveles. Existe un acceso gratuito de tres análisis diarios de hasta 2.000 palabras, sin cuenta.
Sí: tres análisis diarios de hasta 2.000 palabras, sin necesidad de cuenta. La contrapartida es que el texto introducido en el detector gratuito puede usarse para entrenamiento, y solo las cuentas de pago pueden excluirse. No lo use con material confidencial o de clientes.
No, en las suscripciones. Los créditos de suscripción caducan al final de cada mes si no se usan. Los créditos de pago por uso adquiridos aparte caducan dos años después de la fecha de compra, lo que encaja mejor con cargas irregulares.
Sí, mediante un modelo multilingüe que cubre 30 idiomas, con una precisión global declarada del 97,8 %. Tenga en cuenta que la misma divulgación sitúa su tasa de falsos positivos en 2,4 %, frente al 0,5 % del modelo inglés Lite: apreciablemente más alta según las propias cifras del proveedor.
El proveedor afirma que Turbo 3.0.2 identifica contenido humanizado con hasta un 97 % de precisión y que Academic 0.0.5 resiste herramientas de humanización y elusión con hasta un 92 %. Son cifras internas. Como detección y evasión coevolucionan, cualquier número de este tipo describe el rendimiento frente a las técnicas de elusión disponibles cuando se hizo la prueba.
La distribución en Trustpilot es de 4,6 sobre 1.294 reseñas, con 80 % de cinco estrellas y 12 % de una. Las reseñas positivas se concentran en la atención al cliente más que en la exactitud de la detección. El tema negativo recurrente es la dificultad de cancelación: un reseñador verificado describe un enlace de baja casi invisible, unas ocho ofertas de retención y la imposibilidad de completar la cancelación tras elegir dejar comentarios.
No, ni tampoco ningún competidor. Una puntuación de detección es una verosimilitud estadística, no evidencia de cómo se produjo un texto. Lo más probatorio que ofrece el producto no es la puntuación sino la reproducción de escritura de su extensión de Chrome, que registra cómo se compuso realmente un documento. Una evidencia de proceso de ese tipo es mucho más sólida que cualquier porcentaje, y es la dirección hacia la que se ha movido la práctica más defendible en integridad académica.