goon/scripts/backfill_scene_performer_source.py
goon-foss 034ddd644c feat(dedup): provenance przypisan performerow do scen (scene_performers.source_id)
scene_performers nie zapisywalo, KTO przypisal performera do sceny. Przez to nie dalo
sie odroznic obsady z kanonu od performera doklejonego przez tube-search, ktory
dopasowuje wynik po JEDNYM tokenie zapytania. Stad przypadek "Rapture": 30 z 72 jej
przypisan bylo falszywych (film "The Rapture" z Mimi Rogers, literowka "hymen
raptured", tytuly scen) i trzeba bylo je przegladac recznie, bo nie bylo sygnalu.

Kolumna trzyma NAJBARDZIEJ wiarygodne zrodlo, jakie przypisalo. Regula idzie tylko w
gore: NULL wypelnia cokolwiek, kanon nadpisuje scraper, scraper NIGDY nie zamazuje
kanonu. Inaczej dowolny pozniejszy tube-search zatarlby informacje, ze obsade
potwierdzilo TPDB. To samo przy merge_scenes: przy kolizji przenosimy lepsza
provenance na keepera, zeby scalanie nie degradowalo potwierdzonej obsady.

Backfill wypelnil 4 147 128 wierszy (96,3 procent) wnioskowaniem, ktore jest pewne:
scena z refami z DOKLADNIE jednego zrodla ma cala obsade stamtad. Sceny wielozrodlowe
(67 tys.) zostaja z NULL-em, bo tam zgadywanie zepsuloby sens kolumny. Wsadowo, z
commitem na paczke: pojedynczy UPDATE na 4 mln wierszy trzymalby locki na
scene_performers i zablokowal ingest.

Rozklad: tube-scraper 3 219 677, tpdb 747 540, stashdb 180 355.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-27 15:04:10 +02:00

88 lines
3.1 KiB
Python

"""Backfill `scene_performers.source_id` dla wierszy sprzed migracji 0026.
Wnioskowanie jest pewne tylko dla scen, które mają `scene_external_refs` z DOKŁADNIE
jednego źródła: skoro tylko ono kiedykolwiek dotknęło tę scenę, to cała jej obsada
stamtąd pochodzi. Takich scen jest 3,39 mln i pokrywają 4,15 mln przypisań, czyli ~96%
tabeli. Sceny wieloźródłowe (67 tys.) zostawiamy z NULL-em — tam nie da się powiedzieć,
które źródło przypisało którego performera, a zgadywanie zepsułoby cały sens kolumny.
Granularność jest na poziomie ŹRÓDŁA, nie pojedynczego tuba: wszystkie direct-scrapery
dzielą jeden rekord `sources` (`SCRAPER_SOURCE_NAME`). To wystarcza do pytania, które
było nie do zadania wcześniej: „czy tę obsadę potwierdził kanon, czy dokleił ją
tube-search".
Wsadowo i z osobną transakcją na paczkę — pojedynczy UPDATE na 4 mln wierszy trzymałby
locki na `scene_performers` przez cały czas i zablokował ingest (zdarzyło się przy
migracji 0026: porzucone zapytanie analityczne wstrzymało ALTER TABLE, a za nim ustawiła
się kolejka).
Uruchomienie (kontener worker):
python -m scripts.backfill_scene_performer_source # dry-run
python -m scripts.backfill_scene_performer_source --yes # wykonaj
"""
from __future__ import annotations
import argparse
import logging
from sqlalchemy import text
from app.db import session_scope
log = logging.getLogger(__name__)
_BATCH = 50_000
_COUNT_SQL = """
SELECT count(*) FROM scene_performers sp
WHERE sp.source_id IS NULL
AND (SELECT count(DISTINCT r.source_id) FROM scene_external_refs r
WHERE r.scene_id = sp.scene_id) = 1
"""
# ctid-based batching: bez sztucznego klucza na (scene_id, performer_id) to najtańszy
# sposób na „weź N dowolnych jeszcze niewypełnionych".
_UPDATE_SQL = """
UPDATE scene_performers sp
SET source_id = (
SELECT (array_agg(DISTINCT r.source_id))[1]
FROM scene_external_refs r WHERE r.scene_id = sp.scene_id
)
WHERE sp.ctid IN (
SELECT sp2.ctid FROM scene_performers sp2
WHERE sp2.source_id IS NULL
AND (SELECT count(DISTINCT r.source_id) FROM scene_external_refs r
WHERE r.scene_id = sp2.scene_id) = 1
LIMIT :batch
)
"""
def main() -> None:
logging.basicConfig(level=logging.INFO, format="%(message)s")
ap = argparse.ArgumentParser(description=__doc__)
ap.add_argument("--yes", action="store_true", help="wykonaj (bez tego dry-run)")
ap.add_argument("--batch", type=int, default=_BATCH)
args = ap.parse_args()
with session_scope() as s:
total = int(s.execute(text(_COUNT_SQL)).scalar_one())
log.info("do wypełnienia: %d przypisań (sceny jednoźródłowe)", total)
if not args.yes:
log.info("(dry-run — uruchom z --yes)")
return
done = 0
while True:
with session_scope() as s:
n = int(s.execute(text(_UPDATE_SQL), {"batch": args.batch}).rowcount or 0)
s.commit()
if n == 0:
break
done += n
log.info(" wypełnione %d / %d", done, total)
log.info("GOTOWE: %d wierszy", done)
if __name__ == "__main__":
main()