goon/alembic/versions/20260727_0026_scene_performer_source.py
goon-foss 034ddd644c feat(dedup): provenance przypisan performerow do scen (scene_performers.source_id)
scene_performers nie zapisywalo, KTO przypisal performera do sceny. Przez to nie dalo
sie odroznic obsady z kanonu od performera doklejonego przez tube-search, ktory
dopasowuje wynik po JEDNYM tokenie zapytania. Stad przypadek "Rapture": 30 z 72 jej
przypisan bylo falszywych (film "The Rapture" z Mimi Rogers, literowka "hymen
raptured", tytuly scen) i trzeba bylo je przegladac recznie, bo nie bylo sygnalu.

Kolumna trzyma NAJBARDZIEJ wiarygodne zrodlo, jakie przypisalo. Regula idzie tylko w
gore: NULL wypelnia cokolwiek, kanon nadpisuje scraper, scraper NIGDY nie zamazuje
kanonu. Inaczej dowolny pozniejszy tube-search zatarlby informacje, ze obsade
potwierdzilo TPDB. To samo przy merge_scenes: przy kolizji przenosimy lepsza
provenance na keepera, zeby scalanie nie degradowalo potwierdzonej obsady.

Backfill wypelnil 4 147 128 wierszy (96,3 procent) wnioskowaniem, ktore jest pewne:
scena z refami z DOKLADNIE jednego zrodla ma cala obsade stamtad. Sceny wielozrodlowe
(67 tys.) zostaja z NULL-em, bo tam zgadywanie zepsuloby sens kolumny. Wsadowo, z
commitem na paczke: pojedynczy UPDATE na 4 mln wierszy trzymalby locki na
scene_performers i zablokowal ingest.

Rozklad: tube-scraper 3 219 677, tpdb 747 540, stashdb 180 355.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-07-27 15:04:10 +02:00

49 lines
1.7 KiB
Python

"""provenance przypisań performerów do scen
Revision ID: 0026_scene_performer_source
Revises: 0025_phash_blacklist
Create Date: 2026-07-27
`scene_performers` nie zapisywało, KTO przypisał performera do sceny. Przez to nie da
się odróżnić obsady pochodzącej z kanonu od performera doklejonego przez tube-search
(`_search_base` dopasowuje wynik po JEDNYM tokenie zapytania, więc „Rapture" łapała
każdą scenę ze słowem „rapture" — 30 z 72 jej przypisań było fałszywych i trzeba je
było przejrzeć ręcznie, bo nie było na to żadnego sygnału).
Kolumna nullable, bo dla 4,3 mln istniejących wierszy źródła nie da się odtworzyć —
wypełnia się od teraz, przy kolejnych ingestach.
"""
from collections.abc import Sequence
import sqlalchemy as sa
from alembic import op
from sqlalchemy.dialects import postgresql
revision: str = "0026_scene_performer_source"
down_revision: str | None = "0025_phash_blacklist"
branch_labels: str | Sequence[str] | None = None
depends_on: str | Sequence[str] | None = None
def upgrade() -> None:
op.add_column(
"scene_performers",
sa.Column("source_id", postgresql.UUID(as_uuid=True), nullable=True),
)
op.create_foreign_key(
"fk_scene_performers_source_id_sources",
"scene_performers",
"sources",
["source_id"],
["id"],
ondelete="SET NULL",
)
op.create_index("ix_scene_performers_source_id", "scene_performers", ["source_id"])
def downgrade() -> None:
op.drop_index("ix_scene_performers_source_id", table_name="scene_performers")
op.drop_constraint(
"fk_scene_performers_source_id_sources", "scene_performers", type_="foreignkey"
)
op.drop_column("scene_performers", "source_id")