根據視訊科技公司安訊士(Axis Communications)的統計,截至 2025 年底,全世界除了中國以外的地區,合計共安裝了 5.62 億台的監視攝影機,其中越來越多產品內建智慧功能,尤其是 2024 年後出貨的攝影機中,大約有三分之二都具備深度學習分析能力。
若從這個角度來看,對於那些致力開發「實體人工智慧(Physical AI)」的公司而言,他們所需要的「基礎設施」,其實早已懸掛在世界各地的牆壁和天花板上,而箇中商機就在於,如何讓 AI 模型理解鏡頭前發生的事情,並且讓現有的監視攝影機發揮更多效用。
新創公司 Lumana 正是看中監視攝影機發展潛力的團隊之一,其創辦人 Sagi Ben Moshe 先前是 Intel RealSense 業務的主要領導者,公司技術長 Ofir Mulla 則負責開發 3D 及 LiDAR 攝影機幕後架構。
擁有 Intel 電腦視覺技術經驗與血脈的 Lumana,目前已經可以透過自行開發的 AI 視訊監控系統,每天處理超過 50,000 台攝影機所帶來的逾十億張影像,並借助 AI 提供的可理解性與可搜尋性,分析正在發展中的各種事件。
讓人類注意「應該被注意」的事件
過去數十年以來,無論是哪裡的保全監控室通常都有一面電視牆,呈現來自每一支監視攝影機的即時畫面,至於身處其中的保全和員工,其任務就是在出現異狀時及時察覺。
然而真正的情況是,在大多數日子裡沒有人會特地去觀看監視器畫面,被錄下的影像只有在包裹遺失、發生意外,或是有人需要從某個事件中查明真相時,監視器畫面才會派上用場。
換句話說,雖然監視攝影機早已數位化,但其所拍攝的影像,卻仍高度仰賴於有人知道「該尋找什麼」以及「要在哪裡找」。為此 Lumana 技術長 Ofir Mulla 認為,與其讓人類長時間盯著電視牆,試圖找出異常情況,不如讓員工將注意力集中在真正需要被調查的事情上。
「正常」的定義會經常改變
只不過,若想要讓 AI 模型借助影像分析,透過監視器畫面做到這一點的關鍵即在於「情境」,這也是傳統的動作偵測技術與固定規則難以掌握之處。
舉例來說,在下午 2 點時,若有人站在電商倉庫的門旁可能完全正常;但若同樣狀況在凌晨 2 點發生,那就會值得進一步調查;又比如一輛貨車停在倉庫門口 20 分鐘,這通常不會有什麼問題,但若同一輛貨車停在原地長達三個小時,就可能意味著情況有些異常。
Lumana 所發的 VIA-1 模型,不只是能夠進行影像分析,它更會從每台監視攝影機所捕捉的環境之中學習,避免於所有地方、所有時間,全都套用相同的「正常」情況定義與告警規則。
相較於傳統動作偵測與固定規則系統,Lumana 指出 VIA-1 可以將告警誤報率降低高達 90%。
人類提供 AI 回饋的關鍵作用
然而,當環境本身發生變化時,才是真正考驗 AI 能力的時刻,因為監視攝影機與 AI 模型眼中看似正常的景象,轉眼之間就可能發生變化。
舉例來說,安裝有 AI 監視系統的出貨倉庫,業者可能會選在非工作日重新調整產品擺放佈局;迎接節假日出貨高峰時,倉庫的人流也會發生變化;又比方業者決定新增夜班,導致數十名員工湧入以往凌晨時段本應空無一人的區域等,這些於昨日可能觸發異常警報的活動,隔天卻會變成正常行為。
對此 Ofir Mulla 說明,VIA-1 模型能夠隨著環境變化,調整 AI 模型對監視器畫面的理解,而當環境發生實質性改變時,人類員工的回饋將有助於 AI 學習新的變化,只是調整時間需要取決於變化的規模與類型而定。
一套真正實用的 AI 監視系統,必須學會將後來增加的新模式當作常態,同時依然察覺出異常活動。由此可見,人類操作員還是十分重要的環節,尤其是在環境出現重大變化時,員工的回饋才能讓系統於持續變動的環境中不斷學習。
以影像觸發行動的「實體 AI 代理」
當然,讓 AI 透過攝影機監視著人類工作,使影像資料變得更容易搜尋與理解,無可避免將引發隱私疑慮,特別是在工作場域之中。
因此 Lumana 允許客戶根據當地法規要求,設定資料保留與存取政策,並選擇性停用臉部、性別識別等功能。
Ofir Mulla 也進一步闡述 AI 監視系統的願景,他認為未來應該將監控、驗證和回應功能,組合成一套「實體 AI 代理」,目前 Lumana 則已經實現了其中的一部分。
實體 AI 代理的願景將讓監視器於企業內部扮演截然不同的角色,例如使影像資料成為軟體的輸入資訊,並用於讓 AI 模型解析事件,而在某些情況下,甚至可以由監視系統本身,觸發後續於現實世界中的各種行動。
地端承擔多數任務,先篩選再花錢
另一方面,企業對於分析影像內容最大的顧慮,終究在於成本。畢竟大規模傳輸和處理影像的開銷十分昂貴,若是將每一幀影像都傳送至雲端,進行更密集的 AI 處理與分析,支出勢必會迅速飆升,尤其隨著攝影機解析度和部署規模的擴大,開銷還會進一步加劇。
為此 Lumana 端出的解決方案,就是將大部分初步分析工作,交由本地端硬體直接處理,並且把核心設備安裝在攝影機附近。根據 Lumana 說法,大多數的影像分析任務皆在本地端進行,而雲端僅提供額外的處理功能、遠端存取及跨站點管理服務。
Lumana 將前述概念包裝成一句話:「先篩選,再花錢」。Ofir Mulla 強調,絕大部分的監視器影像,其內容都是「稀鬆平常」的例行畫面,所以只有那些值得深入分析的影像,才需要進行更昂貴的處理。
讓影像成為實體 AI 的自然起點
對於發展實體 AI 技術的公司來說,若能夠善加運用監視器影像,將具備一項巨大發展優勢。
目前全世界已有數億台攝影機,正對準工廠、商店、大學、倉庫及城市街道,這讓實體 AI 業者,例如機器人公司不必製造數百萬台產品,就能輕鬆取得、利用這些來自真實世界的畫面。
假如 AI 未來能夠在事件發生時,有效解析透過監視器傳來的影像資料,並且即時掌握環境狀況,就可以進一步推展到 AI 代理接下來可以採取哪些行動,讓監視攝影機成為人工智慧進軍實體世界時,最自然也最合理的起點。
從實驗室到產線,機器人正重新定義產業的樣貌。如果你也想站在第一線追蹤這場變革、寫出有觀點與洞察力的報導,《TechOrange 科技報橘》正在徵內容編輯!
👉了解職缺內容
【推薦閱讀】
◆ 【機器人的下一關:聽覺】會走路、拿東西還不夠,聽不懂人話就難被採用
◆ 【保全業的自動化轉折】機器狗接手體育場重複巡邏工作,不為取代人力而是留才
◆ 人形機器人終於能拆除鐵籠?Digit 5 靠 360 度動態感測,實現免護欄近距共工
*本文開放合作夥伴轉載,參考資料:The Next Web、Lumana,首圖來源:Pixabay
(責任編輯:鄒家彥)



