Commit Graph
5 Commits
Author SHA1 Message Date
ChemaVXandClaude Opus 5 32f0b2c1ab fix(seo): el reintento estricto llevaba meses sin ejecutarse
Build & Deploy ResearchOwl / build-and-push (push) Successful in 8s
`_raw` mandaba `temperature=0.0` a `messages.create`, y anthropic 1.2.0 dejó de
aceptarlo: los parámetros de muestreo se movieron a `output_config`, que sólo
expone `effort` y `format`. El `except` de abajo convertía el TypeError en un
warning, así que el reintento NUNCA ocurría: se quedaba el primer intento y
entraba el recortador mecánico.

Se vio generando el artículo EN de Trans-en-Provence: `custom_excerpt` quedó en
389 caracteres contra un tope de 300, porque el recorte limpio lo habría dejado
demasiado corto y el reintento que debía acortarlo con criterio estaba muerto.

Lo que hacía vincular el reintento no era la temperatura: es el turno de edición
—se le devuelve su propio JSON para que lo acorte, en vez de re-tirar de cero— y
un `max_tokens` más corto. Los dos siguen.

Y el `except` deja de disfrazar un error de programación: un TypeError se
registra como error, no como aviso. Así fue como esto vivió en silencio.

Los kwargs salen a `_create_kwargs()` para que un test los compare con la firma
del SDK instalado. ⚠️ Ese test NO puede fallar hoy en local: el host tiene
anthropic 0.102.0 y el pod 1.2.0, porque requirements.txt pone un suelo
(`>=0.40.0`) y el CI no corre los tests. Verificado a mano dentro del pod: con
`temperature` la firma lo rechaza, sin él pasa. El pin y el pytest en CI van
aparte.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01EHakatofHeJAzdXL26Q5bq
2026-09-02 08:53:28 +00:00
ChemaVXandClaude Opus 5 8b81ef87e4 seo: arreglar la capitalización ES en el ORIGEN, y el motor apuntando al blog malo
Build & Deploy ResearchOwl / build-and-push (push) Successful in 9s
Capa 1 del plan del 2026-07-29: lo que se arregla en el generador se arregla
una vez; lo que se arregla con un vigilante es trabajo para siempre.

1) MAYÚSCULA DE ORACIÓN EN ES. El prompt no decía nada de capitalización, solo
   «write in SPANISH». Un modelo entrenado en inglés escribe Title Case en
   cuanto le pides un «SEO title»: por eso hubo que corregir a mano NOVENTA Y
   UN campos del blog ES.

   Va en el prompt y NO en un validador, y esto es una decisión medida, no una
   comodidad. Distinguir «Lo que Revelan» (mal) de «el Roswell de Pennsylvania»
   (bien) exige saber qué palabra es nombre propio. Probé dos detectores
   deterministas contra el corpus real antes de escribir ninguno:
     - por proporción de palabras capitalizadas: 100% de falsos positivos en
       títulos densos en topónimos («Kecksburg 1965: el Roswell de Pennsylvania»
       da 2/2)
     - por vocabulario en minúscula del corpus: se deja LA MITAD de los malos
       («Ocultan» nunca aparece en minúscula) y marca «Proyecto Libro Azul» y
       «Ejército del Aire» como si fueran errores
   Un gate que rechaza borradores válidos es peor que la avería. La red debajo
   sigue siendo seo_watch.check_title_case, que sí tiene el corpus delante y
   desde hoy corre a diario.

2) EL ARTÍCULO, COMO DATO. Va entre <ARTICLE>…</ARTICLE> y los dos prompts
   declaran que lo de dentro no son instrucciones. El cuerpo se redacta a
   partir de fuentes scrapeadas: una página con «ignore previous instructions»
   entraba en el mensaje sin que nadie lo mirara.

3) EL MOTOR APUNTABA AL BLOG EQUIVOCADO. El comentario de autofill decía que
   rules contaba CERO enlaces internos en ES por estar clavado al host del EN,
   y que no se podía arreglar por el vendorizado byte a byte. Ya se puede: el
   canónico ganó usar_sitio() y el vendorizado se resincronizó — llevaba
   desfasado desde el 21-jul, o sea que la CI habría fallado en el próximo
   build. _check_con_sitio() apunta el motor al idioma correcto y RESTAURA el
   global, con la condición de carrera documentada por si algún día se
   paraleliza la generación.

6 tests nuevos (30 en total). Lo que NO se puede verificar aquí: que el prompt
funcione de verdad. Eso solo lo dice el primer borrador ES que genere, y quien
lo va a comprobar es el vigilante diario.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-29 17:28:56 +00:00
ChemaVXandClaude Opus 4.8 6029bebae5 fix(seo): el canónico del ES es el APEX, no www
Build & Deploy ResearchOwl / build-and-push (push) Successful in 10s
Cada enlace interno que el generador escribía en un borrador español apuntaba
a www.zonadeexclusion.com y se comía un 301. El canónico de los dos blogs está
INVERTIDO —EN es www, ES es el apex—, la misma inversión que provocó el 522 y
de la que ya avisa el wrapper ghst-es.

No es teórico: el enlace www suelto que apareció en los-villares salió de aquí.
El corpus ES está limpio hoy, pero el próximo /generate con enlaces lo habría
reintroducido. Nada río abajo lo paraba: seo_watch solo ve el enlace DESPUÉS de
publicar, y ningún test cubría el host.

Añado los dos tests que faltaban, uno por idioma, para fijar la inversión. El
del ES falla contra el valor viejo con el href entero en el mensaje.

Sin tocar rules.py, así que el vendor-sync sigue en verde. Queda documentado el
matiz que este cambio NO arregla: rules.internal_links cuenta cero enlaces en
ES bajo cualquiera de los dos hosts, porque ese módulo está clavado al host EN
(se vendoriza byte a byte y la CI lo verifica). Inofensivo hoy —
internal_links.too_few no bloquea en borrador.

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-07-21 15:47:39 +00:00
ChemaVXandClaude Fable 5 dadc030d16 feat(seo): aviso de colisión de tema en /generate blog en
Build & Deploy ResearchOwl / build-and-push (push) Successful in 7s
Al publicar el draft EN en Ghost, el título propuesto se compara contra
los posts published+scheduled del sitio (corpus vía Admin API — incluye
la cola programada, justo el caso del doble Kecksburg del 2026-07-10) con
el topic_collision vendorizado. Si colisiona, el notice de Telegram lleva
un bloque "🚨 Posible colisión de tema" en las tres rutas (live, dryrun,
bare). Nunca bloquea: el draft se crea igual, el humano decide (fusionar,
retitular o enlazar a propósito). Solo lang=en (stopwords inglesas).
Títulos ajenos saneados de entidades Markdown (regla de _safe_send).
Aislamiento: cualquier fallo del check → notice sin bloque y warning en
logs, jamás rompe la publicación.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-10 11:17:33 +00:00
ChemaVXandClaude Fable 5 19efc70539 feat(seo): fijar vocabulario de tags ES en el autofill
Build & Deploy ResearchOwl / build-and-push (push) Successful in 6s
Cierra el TODO de ALLOWED_TAGS: el allow-list ES son los 6 tags del
núcleo vivo de zonadeexclusion (Admin API, 2026-07-03), espejo de la
lista EN confirmada: uap, desclasificados, casos-militares,
casos-clasicos, investigacion, casos-espana. Quedan fuera la cola de
tags de 1 post que el modelo inventó antes de constreñir y el duplicado
investigacion-2 (colisión de mayúsculas en Ghost).

La regla anti-legacy 'never use "investigacion"' del prompt pasa a ser
solo-EN: en ES ese slug es el tag canónico del allow-list.

Tests de las funciones puras (_coerce, _system_prompt) por idioma.

Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
2026-07-03 07:52:26 +00:00