scene_performers nie zapisywalo, KTO przypisal performera do sceny. Przez to nie dalo sie odroznic obsady z kanonu od performera doklejonego przez tube-search, ktory dopasowuje wynik po JEDNYM tokenie zapytania. Stad przypadek "Rapture": 30 z 72 jej przypisan bylo falszywych (film "The Rapture" z Mimi Rogers, literowka "hymen raptured", tytuly scen) i trzeba bylo je przegladac recznie, bo nie bylo sygnalu. Kolumna trzyma NAJBARDZIEJ wiarygodne zrodlo, jakie przypisalo. Regula idzie tylko w gore: NULL wypelnia cokolwiek, kanon nadpisuje scraper, scraper NIGDY nie zamazuje kanonu. Inaczej dowolny pozniejszy tube-search zatarlby informacje, ze obsade potwierdzilo TPDB. To samo przy merge_scenes: przy kolizji przenosimy lepsza provenance na keepera, zeby scalanie nie degradowalo potwierdzonej obsady. Backfill wypelnil 4 147 128 wierszy (96,3 procent) wnioskowaniem, ktore jest pewne: scena z refami z DOKLADNIE jednego zrodla ma cala obsade stamtad. Sceny wielozrodlowe (67 tys.) zostaja z NULL-em, bo tam zgadywanie zepsuloby sens kolumny. Wsadowo, z commitem na paczke: pojedynczy UPDATE na 4 mln wierszy trzymalby locki na scene_performers i zablokowal ingest. Rozklad: tube-scraper 3 219 677, tpdb 747 540, stashdb 180 355. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
49 lines
1.7 KiB
Python
49 lines
1.7 KiB
Python
"""provenance przypisań performerów do scen
|
|
|
|
Revision ID: 0026_scene_performer_source
|
|
Revises: 0025_phash_blacklist
|
|
Create Date: 2026-07-27
|
|
|
|
`scene_performers` nie zapisywało, KTO przypisał performera do sceny. Przez to nie da
|
|
się odróżnić obsady pochodzącej z kanonu od performera doklejonego przez tube-search
|
|
(`_search_base` dopasowuje wynik po JEDNYM tokenie zapytania, więc „Rapture" łapała
|
|
każdą scenę ze słowem „rapture" — 30 z 72 jej przypisań było fałszywych i trzeba je
|
|
było przejrzeć ręcznie, bo nie było na to żadnego sygnału).
|
|
|
|
Kolumna nullable, bo dla 4,3 mln istniejących wierszy źródła nie da się odtworzyć —
|
|
wypełnia się od teraz, przy kolejnych ingestach.
|
|
"""
|
|
from collections.abc import Sequence
|
|
|
|
import sqlalchemy as sa
|
|
from alembic import op
|
|
from sqlalchemy.dialects import postgresql
|
|
|
|
revision: str = "0026_scene_performer_source"
|
|
down_revision: str | None = "0025_phash_blacklist"
|
|
branch_labels: str | Sequence[str] | None = None
|
|
depends_on: str | Sequence[str] | None = None
|
|
|
|
|
|
def upgrade() -> None:
|
|
op.add_column(
|
|
"scene_performers",
|
|
sa.Column("source_id", postgresql.UUID(as_uuid=True), nullable=True),
|
|
)
|
|
op.create_foreign_key(
|
|
"fk_scene_performers_source_id_sources",
|
|
"scene_performers",
|
|
"sources",
|
|
["source_id"],
|
|
["id"],
|
|
ondelete="SET NULL",
|
|
)
|
|
op.create_index("ix_scene_performers_source_id", "scene_performers", ["source_id"])
|
|
|
|
|
|
def downgrade() -> None:
|
|
op.drop_index("ix_scene_performers_source_id", table_name="scene_performers")
|
|
op.drop_constraint(
|
|
"fk_scene_performers_source_id_sources", "scene_performers", type_="foreignkey"
|
|
)
|
|
op.drop_column("scene_performers", "source_id")
|