seo_watch: estado por sitio; seo_link: busca en todas las tarjetas
Dos falsas señales, una en cada sentido. seo_watch guardaba UNA huella de los dos blogs juntos. Una ejecución manual con --site en la machacaba con media huella, y el siguiente disparo del timer creía que todo había cambiado: te reenviaba hallazgos viejos como si fueran nuevos. Un vigilante que cría falsas alarmas se acaba ignorando, que es justo lo que este no se puede permitir. Ahora el estado es por sitio y solo se toca el de los sitios revisados. El formato antiguo migra solo. seo_link, en mobiledoc, solo miraba cards[0]. Un cuerpo repartido en varias tarjetas —lo que pasa en cuanto el artículo lleva una imagen intercalada— respondía «no aparece en la prosa» con el anchor delante. Como los dos formatos acaban en diccionarios con clave "html", ahora se tratan igual: una lista de trozos que se recorre entera. Sale más corto que antes. Probado con la secuencia que rompía —revisión completa, manual solo de EN, completa otra vez sin cambios— comprobando que la huella del ES sobrevive y que la última calla; más un cambio real, que sí avisa. Y el de seo_link con el anchor en la SEGUNDA tarjeta, verificado además contra el código viejo, donde falla. Migrado el estado real en el master: los dos blogs siguen sin hallazgos y la migración no ha generado ningún aviso. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 4.8
parent
d381c0225c
commit
9c76ed87ff
+20
-11
@@ -225,25 +225,34 @@ def main():
|
||||
+ (f"\n …{ctx}…" if ok else " (no aparece en la prosa)"))
|
||||
campo, valor = "lexical", json.dumps(lex, ensure_ascii=False)
|
||||
else:
|
||||
# Los dos formatos acaban en diccionarios con clave "html", así que se
|
||||
# tratan igual: una LISTA de trozos. Antes el mobiledoc solo miraba
|
||||
# cards[0], y un cuerpo repartido en varias tarjetas —que es justo lo
|
||||
# que pasa cuando el artículo lleva una imagen intercalada— respondía
|
||||
# «no aparece en la prosa» estando el anchor en la segunda.
|
||||
if fmt == "lexical-html":
|
||||
doc = json.loads(post["lexical"])
|
||||
trozo = doc["root"]["children"][0]
|
||||
get_html, set_html = (lambda: trozo["html"]), (lambda h: trozo.__setitem__("html", h))
|
||||
trozos = [doc["root"]["children"][0]]
|
||||
campo = "lexical"
|
||||
else:
|
||||
doc = json.loads(post["mobiledoc"])
|
||||
cards = [c for c in doc.get("cards", []) if c and c[0] == "html"]
|
||||
if not cards:
|
||||
trozos = [c[1] for c in doc.get("cards", []) if c and c[0] == "html"]
|
||||
if not trozos:
|
||||
sys.exit(f"✗ {a.slug}: mobiledoc sin tarjetas html")
|
||||
tarjeta = cards[0][1]
|
||||
get_html, set_html = (lambda: tarjeta["html"]), (lambda h: tarjeta.__setitem__("html", h))
|
||||
html = get_html()
|
||||
campo = "mobiledoc"
|
||||
if len(trozos) > 1:
|
||||
print(f" ({len(trozos)} trozos de html; se busca en todos)")
|
||||
|
||||
for anchor, url in pares:
|
||||
html, ok, ctx = link_in_html(html, anchor, url)
|
||||
ok, ctx = False, ""
|
||||
for t in trozos:
|
||||
t["html"], ok, ctx = link_in_html(t["html"], anchor, url)
|
||||
if ok:
|
||||
break
|
||||
print(f" {'+' if ok else '⚠'} «{anchor}» → {url.split('/')[-2][:34]}"
|
||||
+ (f"\n …{ctx}…" if ok else " (no aparece en la prosa)"))
|
||||
revisar_html(html, a.slug)
|
||||
set_html(html)
|
||||
campo = "lexical" if fmt == "lexical-html" else "mobiledoc"
|
||||
for t in trozos:
|
||||
revisar_html(t["html"], a.slug)
|
||||
valor = json.dumps(doc, ensure_ascii=False)
|
||||
|
||||
if not a.apply:
|
||||
|
||||
Reference in New Issue
Block a user