RadiografIA

A contraluz se nota todo.

Créditos y licencias

El código y los paquetes de reglas de RadiografIA tienen licencia Apache 2.0. Lo ajeno que usa esta web conserva sus propias condiciones: aquí está cada pieza, con la atribución que pide su licencia.

Los textos de personas

El resultado compara tu texto con textos escritos por personas, del mismo tipo y de la misma longitud. De esos textos, la web solo lleva cifras, los percentiles de cada medida: ni una frase. Estos son sus corpus.

Noticias

UD Spanish-AnCora r2.18: noticias de la agencia EFE y de El Periódico, del año 2000. De Taulé, Martí y Recasens (AnCora, CLiC-UB); conversión a Universal Dependencies de Martínez Alonso y Zeman. Licencia CC BY 4.0.

Taulé, M., M.A. Martí, M. Recasens (2008) 'Ancora: Multilevel Annotated Corpora for Catalan and Spanish', Proceedings of 6th International Conference on Language Resources and Evaluation. Marrakesh (Morocco).

Textos administrativos

Disposiciones, resoluciones y anuncios del Boletín Oficial del Estado publicados entre 2000 y 2021, reutilizados según la licencia tipo de la Agencia Estatal Boletín Oficial del Estado (Resolución de 27 de junio de 2024).

Basado en datos de la Agencia Estatal Boletín Oficial del Estado

Narrativa clásica

Capítulos de novelas y cuentos en español de autores que murieron en 1945 o antes: dominio público en España. Los textos salen de las ediciones digitales de Project Gutenberg.

Textos académicos

CSIC Spanish Corpus 1.0.0, del Barcelona Supercomputing Center dentro del Plan de Tecnologías del Lenguaje (SEDIA, 2022): artículos de las revistas científicas del Consejo Superior de Investigaciones Científicas. Licencia CC BY 4.0.

Críticas de cine

Críticas de usuarios de www.muchocine.net. Licencia CC BY 2.1 ES, según declaran quienes las recogieron:

Cruz, F. L., Troyano, J. A., Enriquez, F., & Ortega, J. (2008). Clasificación de documentos basada en la opinión: experimentos con un corpus de críticas de cine en español. Procesamiento del lenguaje natural, 41.

General

Una mezcla de los cinco corpus anteriores, con el mismo número de textos de cada uno; cada texto conserva la licencia del suyo.

Las fuentes tipográficas

Las dos tienen licencia SIL Open Font License 1.1. Aquí van recortadas a los caracteres latinos y, las del informe en PDF, además, en otro formato.

Literata, la del texto

Copyright 2017 The Literata Project Authors.

Atkinson Hyperlegible Next, la de la interfaz

Copyright 2020-2024 The Atkinson Hyperlegible Next Project Authors.

El código ajeno que llega a tu navegador

El aviso de licencia de cada uno viaja dentro del propio JavaScript.

Ajv

De Evgeny Poberezkin, con licencia MIT. Valida cada paquete de reglas: viaja una función suya y el código que genera para nuestros esquemas.

silabea

De Javier Arce, sobre silabajs, de Nicolás Cofré Méndez, con licencia MIT. Separa las palabras en sílabas para medir la legibilidad.

pdfmake

De bpampuch y liborm85, con licencia MIT, y las piezas que lleva dentro, pdfkit y fontkit entre ellas: 76 en total, cada una con su licencia. Genera el informe en PDF y solo se carga al pulsar «Descargar informe».

Vite

De VoidZero Inc. y sus colaboradores, con licencia MIT. Construye esta web y deja en ella su función para cargar, al pulsar «Descargar informe», el código que genera el PDF.

Rolldown

De VoidZero Inc. y sus colaboradores, con licencia MIT. Es el empaquetador de Vite, y deja en la web sus ayudantes para cargar el código CommonJS de silabea y de pdfmake.

Las listas de frecuencia

wordfreq

De Robyn Speer: las 20.000 palabras más frecuentes del español, con datos de Wikipedia, OpenSubtitles 2018, NewsCrawl, GlobalVoices, Google Books Ngrams, OSCAR, Twitter y Reddit. Licencia CC BY-SA 4.0.

Está en el repositorio para una versión futura: ninguna regla de esta la usa, y no llega a esta web.

La lista completa

THIRD-PARTY-NOTICES.md

Cada pieza con su versión, su huella y el texto entero de su licencia, en el repositorio de RadiografIA.