ended3월 18일· 1 sources
Cleaning Cinema Titles Before You Can Even Search
영화 검색 전 단계: 극장 상영 제목 정제하기
Why it matters
Clusterflick scrapes 250+ cinema websites but must first normalise messy film titles before TMDB matching. A pipeline strips venue branding, event labels, and separators using ~1,000 known phrases and correction lists, backed by nearly 15,000 test cases. Edge cases like legitimate '+' in titles (e.g. Romeo + Juliet) require special handling to avoid false splits.
1
Sources
+0
24h
—
Growth
179d
Active
ClusterflickTMDBcinema listingstitle normalisationweb scraping