Guías de documentos

Por qué el texto chino aparece como recuadros o caracteres ilegibles

Google Ad Placeholder

La gente a menudo dice que un archivo «necesita conversión» cuando el problema real es la codificación o las fuentes. Los síntomas se parecen si no lee chino todos los días. Los arreglos no. Ejecutar OpenCC sobre un archivo roto no recuperará los caracteres del autor. Mapeará sinsentido a otro sinsentido.

Recorra los síntomas siguientes antes de subir nada.

Recuadros (tofu)

Un recuadro hueco o un cuadrado de tofu suele significar que el carácter existe como punto de código pero la fuente actual no tiene glifo. Los datos ya pueden ser correctos. Cambie la fuente a una con cobertura CJK. Vea fuentes chinas y Unicode.

Si cada carácter chino es un recuadro, la fuente es el primer sospechoso. Si solo algunos caracteres son recuadros, puede tener una mezcla de grafos raros, un subconjunto de fuente o un glifo regional que la fuente nunca incluyó.

No convierta aún. Si los recuadros ocultan caracteres tradicionales que ya quería, la conversión es la palanca equivocada.

Signos de interrogación

Un ? que sustituyó a un carácter a menudo significa que el texto se forzó por un conjunto de caracteres que no podía almacenarlo. Guardar una frase china UTF-8 como Latin-1, o pegar por una pasarela SMS antigua, es un camino típico. El carácter original ya puede haberse ido. La conversión no puede reconstruirlo.

Si aún tiene el correo de origen o el .docx original, vuelva a ese. La copia con signos de interrogación es un cadáver.

Texto ilegible (mojibake)

Cadenas como 涓浗 en lugar de 中国 son bytes UTF-8 leídos con la codificación equivocada, o al revés. La página está llena de caracteres raros o sin sentido que un lector chino rechaza de inmediato.

Vuelva a abrir el archivo con UTF-8 si aún tiene el origen. En Word, pruebe el diálogo de codificación al abrir un archivo de texto simple. En un navegador, pruebe el menú de codificación si mira un sitio antiguo.

Si solo existe la copia rota, la reparación automática es irregular. Algunas herramientas adivinan UTF-8 frente a GBK frente a Big5. Adivinar puede empeorar las cosas. Trabaje sobre una copia.

El texto ilegible aparece en los problemas habituales de conversión porque la gente lo convierte por accidente y luego tiene dos problemas.

Escrituras mezcladas que se ven «casi chinas»

Las frases japonesas pueden verse relacionadas. No son una entrada OpenCC segura. Si un archivo es bilingüe, extraiga la parte china. El hanja coreano es la misma advertencia.

Un PDF de una fotografía no es ilegible en el sentido de la codificación. No es texto. Vea la guía de PDF.

Cuándo la conversión es el siguiente paso correcto

Si puede leer el chino y solo quiere formas simplificadas o tradicionales, use el convertidor de documentos o el convertidor de texto. Si no puede leerlo, arregle primero la codificación o las fuentes.

Una prueba corta: copie una frase al convertidor de texto. Si el recuadro de entrada ya muestra basura, deténgase. Si la entrada es legible y la salida es la otra norma, el archivo estaba bien y puede convertir el resto.

Un orden de diagnóstico

  1. ¿Puede resaltar y copiar una frase china real? Si no, tiene un escaneo, contornos o una fuente tan rota que no puede ver el texto.
  2. ¿Cambiar la fuente hace aparecer la frase? Si sí, tenía recuadros, no un trabajo de conversión.
  3. ¿La copia se ve como caracteres raros aleatorios? Si sí, tiene texto ilegible.
  4. ¿Hay signos de interrogación en medio de las palabras? Si sí, los datos ya se perdieron.
  5. Solo entonces elija un tipo OpenCC y convierta.

Preguntas frecuentes

Mi colega ve chino y yo veo recuadros. ¿Quién tiene razón? Ambos. El archivo puede ser correcto y su cobertura de fuente puede ser equivocada. Instale una fuente CJK antes de pedirles que vuelvan a convertir.

¿Puede este sitio reparar el texto ilegible? No. Convierte normas chinas legibles.

¿Por qué una página web se veía bien y el archivo descargado se ve mal? El navegador adivinó una codificación. El archivo guardado congeló la conjetura equivocada.

¿Big5 es lo mismo que el chino tradicional? Big5 es una codificación antigua usada para mucho texto tradicional. Los caracteres tradicionales Unicode son el almacenamiento moderno. Un archivo Big5 abierto por error como UTF-8 se convierte en texto ilegible.

¿Debo convertir un archivo para «arreglar» los signos de interrogación? No. Recupere el origen.

Google Ad Placeholder