智能門鈴品牌 Ring 公開其「語義影片搜尋」背後的技術架構,揭示如何利用 Amazon RDS for PostgreSQL 和 pgvector 擴充處理高達 2,000 億個向量嵌入(embeddings),用戶只需輸入「後院有隻狗」或「穿藍色恤衫的人」,系統便能在 2 秒內從數日甚至數周的錄影中找到相關片段。
Ring 的使命是「讓社區更安全」,其系統每日在全球數百萬部裝置上產生海量影片數據,技術團隊選擇以 PostgreSQL 配合 pgvector 擴充,將影片幀轉換為捕捉視覺內容的數值向量,再透過相似度搜尋實現「理解語義而非依賴關鍵字」的檢索。
根據 AWS 資料庫官方網誌,Ring 的系統橫跨四大洲、9 個 AWS 區域,每日處理數十億次讀取請求,儲存 1,000 億至 2,000 億個向量嵌入,數據足跡達 140 至 150 TB 以上,分佈於 3 個 PostgreSQL 叢集,延遲目標為中位數 200 毫秒以內,最差情況亦在 2 秒內完成搜尋。
理解語義實現極速檢索
這項技術突破打破了傳統限制,傳統影片搜尋依賴用戶手動標記或時間軸拖曳,而語義搜尋則讓系統「理解」畫面內容,當用戶輸入「包裹送遞」,系統會將文字轉換為向量,再與影片幀的向量進行比對,找出語義上最接近的片段,無需預先定義標籤。
Ring 選擇 PostgreSQL 而非專用向量資料庫,反映一個務實的工程決策:在已有關聯式資料庫上擴充向量搜尋能力,能降低系統複雜度,並利用現有的備份、擴充和管理工具,這對需要同時處理傳統業務數據和新興 AI 應用的企業,提供了可參考的技術路徑。
對香港智能家居市場而言,隨着鏡頭普及,如何從海量影片中快速找到關鍵片段,將成為用戶體驗的分水嶺,Ring 的案例顯示,這背後除了需要 AI 模型,更需要一套能同時處理千億級向量數據、兼顧成本與效能的資料庫架構。
高寫入壓力下的架構考量與私隱疑慮
Ring 的技術選型還有一個容易被忽略的細節:每日新增約 20 億個向量嵌入,讀寫比例約 8 比 2,這意味著系統除了要「搜得快」,更要「吞得快」——數百萬部裝置全天候上傳影像,寫入壓力從不間斷。pgvector 在這種寫入密集型場景下仍能保持穩定,打破了「關聯式資料庫不適合向量搜尋」的成見,為企業的技術選型提供了新的思考框架。
語義搜尋對私隱的影響同樣值得關注,當系統能理解「穿藍色恤衫的人」,理論上也能搜尋「某個特定面孔」。Ring 作為 Amazon 旗下品牌,其影像數據的處理方式一直備受關注,技術能力愈強,公眾對其使用邊界的質疑便愈大。這提醒所有發展影像 AI 的企業:技術可行之後,倫理與規管的討論必須同步跟上,否則創新隨時變成公關災難。
這套架構的成本效益同樣驚人,在千億級向量的規模下,專用向量資料庫的授權和運維開支可以相當可觀;Ring 選擇基於開源 PostgreSQL 的 Amazon RDS,配合託管服務的自動備份、修補和擴充,把資料庫團隊的營運負擔降至最低。這提醒企業架構師:面對新興 AI 工作負載,「最潮」的方案未必是「最對」的方案,成熟技術的邊界往往比想像中寬。
