0

0
0

文字

分享

0
0
0

虛擬試衣間! virtual dressing room

Scimage
・2011/07/13 ・419字 ・閱讀時間少於 1 分鐘 ・SR值 481 ・五年級

融合虛擬與真實影像常常帶來新的應用,之前介紹過虛擬化妝模擬器就是一例。這次的影片是介紹虛擬試衣間,像是kinect之類的及時動作捕捉技術的成熟。目前已經有簡單的方案把即時的人體影像轉成電腦立體模型,這也意味著可以利用電腦的計算能力及時把各種不同的虛擬物件直接跟人體模型互動。

影片中介紹的是可以把想要試穿的衣服、皮包、配件等直接在電腦裡試穿,讓一些可能的搭配直接呈現出來。雖然系統還不完美,不過接下來幾年一定會改善。這樣的技術或許在以後的網路衣物購物上,能幫消費者做出更好的購買判斷。

影片中最後也展示了可以模擬穿著衣物滑雪的模樣,當然同樣類型的虛擬場景也可以利用像是電視製作或是舞台表演的場合。這些都是接近成熟的技術了,之後就等待有創意的朋友來找到更合適的應用跟發揮想像了!

本文原發表於 Scimage 科學影像 [2011. 7. 12]

-----廣告,請繼續往下閱讀-----
文章難易度
Scimage
113 篇文章 ・ 4 位粉絲
每日介紹科學新知, 科普知識與實際實驗影片-歡迎每一顆好奇的心 @_@!

0

8
2

文字

分享

0
8
2
快!還要更快!讓國家級地震警報更好用的「都會區強震預警精進計畫」
鳥苷三磷酸 (PanSci Promo)_96
・2024/01/21 ・2584字 ・閱讀時間約 5 分鐘

-----廣告,請繼續往下閱讀-----

本文由 交通部中央氣象署 委託,泛科學企劃執行。

  • 文/陳儀珈

從地震儀感應到地震的震動,到我們的手機響起國家級警報,大約需要多少時間?

臺灣從 1991 年開始大量增建地震測站;1999 年臺灣爆發了 921 大地震,當時的地震速報系統約在震後 102 秒完成地震定位;2014 年正式對公眾推播強震即時警報;到了 2020 年 4 月,隨著技術不斷革新,當時交通部中央氣象局地震測報中心(以下簡稱為地震中心)僅需 10 秒,就可以發出地震預警訊息!

然而,地震中心並未因此而自滿,而是持續擴建地震觀測網,開發新技術。近年來,地震中心執行前瞻基礎建設 2.0「都會區強震預警精進計畫」,預計讓臺灣的地震預警系統邁入下一個新紀元!

-----廣告,請繼續往下閱讀-----

連上網路吧!用建設與技術,換取獲得地震資料的時間

「都會區強震預警精進計畫」起源於「民生公共物聯網數據應用及產業開展計畫」,該計畫致力於跨部會、跨單位合作,由 11 個執行單位共同策畫,致力於優化我國環境與防災治理,並建置資料開放平台。

看到這裡,或許你還沒反應過來地震預警系統跟物聯網(Internet of Things,IoT)有什麼關係,嘿嘿,那可大有關係啦!

當我們將各種實體物品透過網路連結起來,建立彼此與裝置的通訊後,成為了所謂的物聯網。在我國的地震預警系統中,即是透過將地震儀的資料即時傳輸到聯網系統,並進行運算,實現了對地震活動的即時監測和預警。

地震中心在臺灣架設了 700 多個強震監測站,但能夠和地震中心即時連線的,只有其中 500 個,藉由這項計畫,地震中心將致力增加可連線的強震監測站數量,並優化原有強震監測站的聯網品質。

-----廣告,請繼續往下閱讀-----

在地震中心的評估中,可以連線的強震監測站大約可在 113 年時,從原有的 500 個增加至 600 個,並且更新現有監測站的軟體與硬體設備,藉此提升地震預警系統的效能。

由此可知,倘若地震儀沒有了聯網的功能,我們也形同完全失去了地震預警系統的一切。

把地震儀放到井下後,有什麼好處?

除了加強地震儀的聯網功能外,把地震儀「放到地下」,也是提升地震預警系統效能的關鍵做法。

為什麼要把地震儀放到地底下?用日常生活來比喻的話,就像是買屋子時,要選擇鬧中取靜的社區,才不會讓吵雜的環境影響自己在房間聆聽優美的音樂;看星星時,要選擇光害比較不嚴重的山區,才能看清楚一閃又一閃的美麗星空。

-----廣告,請繼續往下閱讀-----

地表有太多、太多的環境雜訊了,因此當地震儀被安裝在地表時,想要從混亂的「噪音」之中找出關鍵的地震波,就像是在搖滾演唱會裡聽電話一樣困難,無論是電腦或研究人員,都需要花費比較多的時間,才能判讀來自地震的波形。

這些環境雜訊都是從哪裡來的?基本上,只要是你想得到的人為震動,對地震儀來說,都有可能是「噪音」!

當地震儀靠近工地或馬路時,一輛輛大卡車框啷、框啷地經過測站,是噪音;大稻埕夏日節放起絢麗的煙火,隨著煙花在天空上一個一個的炸開,也是噪音;台北捷運行經軌道的摩擦與震動,那也是噪音;有好奇的路人經過測站,推了推踢了下測站時,那也是不可忽視的噪音。

因此,井下地震儀(Borehole seismometer)的主要目的,就是盡量讓地震儀「遠離塵囂」,記錄到更清楚、雜訊更少的地震波!​無論是微震、強震,還是來自遠方的地震,井下地震儀都能提供遠比地表地震儀更高品質的訊號。

-----廣告,請繼續往下閱讀-----

地震中心於 2008 年展開建置井下地震儀觀測站的行動,根據不同測站底下的地質條件,​將井下地震儀放置在深達 30~500 公尺的乾井深處。​除了地震儀外,站房內也會備有資料收錄器、網路傳輸設備、不斷電設備與電池,讓測站可以儲存、傳送資料。

既然井下地震儀這麼強大,為什麼無法大規模建造測站呢?簡單來說,這一切可以歸咎於技術和成本問題。

安裝井下地震儀需要鑽井,然而鑽井的深度、難度均會提高時間、技術與金錢成本,因此,即使井下地震儀的訊號再好,若非有國家建設計畫的支援,也難以大量建置。

人口聚集,震災好嚴重?建立「客製化」的地震預警系統!

臺灣人口主要聚集於西半部,然而此區的震源深度較淺,再加上密集的人口與建築,容易造成相當重大的災害。

-----廣告,請繼續往下閱讀-----

許多都會區的建築老舊且密集,當屋齡超過 50 歲時,它很有可能是在沒有耐震規範的背景下建造而成的的,若是超過 25 年左右的房屋,也有可能不符合最新的耐震規範,並未具備現今標準下足夠的耐震能力。 

延伸閱讀:

在地震界有句名言「地震不會殺人,但建築物會」,因此,若建築物的結構不符合地震規範,地震發生時,在同一面積下越密集的老屋,有可能造成越多的傷亡。

因此,對於發生在都會區的直下型地震,預警時間的要求更高,需求也更迫切。

-----廣告,請繼續往下閱讀-----

地震中心著手於人口密集之都會區開發「客製化」的強震預警系統,目標針對都會區直下型淺層地震,可以在「震後 7 秒內」發布地震警報,將地震預警盲區縮小為 25 公里。

111 年起,地震中心已先後完成大臺北地區、桃園市客製化作業模組,並開始上線測試,當前正致力於臺南市的模組,未來的目標為高雄市與臺中市。

永不停歇的防災宣導行動、地震預警技術研發

地震預警系統僅能在地震來臨時警示民眾避難,無法主動保護民眾的生命安全,若人民沒有搭配正確的防震防災觀念,即使地震警報再快,也無法達到有效的防災效果。

因此除了不斷革新地震預警系統的技術,地震中心也積極投入於地震的宣導活動和教育管道,經營 Facebook 粉絲專頁「報地震 – 中央氣象署」、跨部會舉辦《地震島大冒險》特展、《震守家園 — 民生公共物聯網主題展》,讓民眾了解正確的避難行為與應變作為,充分發揮地震警報的效果。

-----廣告,請繼續往下閱讀-----

此外,雖然地震中心預計於 114 年將都會區的預警費時縮減為 7 秒,研發新技術的腳步不會停止;未來,他們將應用 AI 技術,持續強化地震預警系統的效能,降低地震對臺灣人民的威脅程度,保障你我生命財產安全。

文章難易度

討論功能關閉中。

鳥苷三磷酸 (PanSci Promo)_96
196 篇文章 ・ 300 位粉絲
充滿能量的泛科學品牌合作帳號!相關行銷合作請洽:contact@pansci.asia

1

6
1

文字

分享

1
6
1
虛擬世界將主宰「全宇宙」?元宇宙的發展近況與未來——《加密貨幣的真相》
先覺出版
・2023/05/12 ・2438字 ・閱讀時間約 5 分鐘

元宇宙是利用雲端伺服器建立的虛擬世界,使用者可以使用虛擬實境 (VR) 或擴增實境 (AR) 進入雲端,以虛擬替身與其他使用者交流,那麼目前已經發展到什麼程度?未來又會如何發展呢?

第一個接近元宇宙的平台:機器磚塊 (Roblox)

講到元宇宙的概念,許多人立刻會想到目前熱門的多人線上角色扮演遊戲,例如:動物森友會、模擬市民、暗黑破壞神、仙劍奇俠傳等。這些線上遊戲可以讓玩家在虛擬的遊戲裡擁有另外一個身分與全新的生活,但由於技術上的限制,這些線上遊戲帶給玩家的沉浸感不足,內容也只是遊戲,與元宇宙希望建立的世界還有很大的差距。

第一個接近元宇宙的平台是「機器磚塊 (Roblox) 」,它不只是一個線上角色扮演遊戲,使用者還可以設計自己的遊戲、物品、衣服,同時遊玩自己或其他開發者建立的各種遊戲,是由像樂高積木般的虛擬磚塊所建構的網路虛擬世界。

就類似於我們的影音創作發表在 YouTube 平台上,或程式設計師的程式創作發表在「應用程式商店 (App Store) 」平台上,經由平台分享讓谷歌 (Google) 分潤的概念。

-----廣告,請繼續往下閱讀-----
機器磚塊(Roblox)。圖/wikipedia

元宇宙的未來可能有兩個發展方向

目前元宇宙的建立還在初期戰國時代多強爭霸的階段,各種不同的社群平台與遊戲廠商都躍躍欲試,因此還沒有系統能夠一統天下,未來誰會勝出仍不確定。元宇宙的未來可能有兩個發展方向:

第一階段:可能是由某家公司主導,但是開放原始程式碼讓任何人都可以使用,類似谷歌建立 Android 平台,讓所有開發者在平台上建立應用程式 (App:Application Program)。

例如:我在臉書的元宇宙要參加舞會,想買一個「虛擬愛馬仕包包」,則必須到「虛擬愛馬仕商店」購買,而愛馬仕公司則必須到臉書的元宇宙裡開設一家虛擬愛馬仕商店,在這裡「虛擬愛馬仕包包」就好像一個應用程式,因此和 Android 平台讓所有開發者在平台上建立應用程式的概念是一樣的。

愛馬仕包包實體店可能沒有賣虛擬愛馬仕包包。圖/wikipedia

第二階段:可能是由某個基金會主導,開放原始程式碼讓任何人都可以使用,不同公司開發的虛擬世界具有相容性,可以串連成大一統的元宇宙,就像我們現在使用相同的通訊協定在網際網路上漫遊一樣,現在我們上網都是使用「超文本轉換傳輸協定 (HTTP:Hyper Text Transfer Protocol) 」。

-----廣告,請繼續往下閱讀-----

假設我們在臉書的元宇宙裡買了一個「虛擬愛馬仕包包」,能不能把它背到谷歌的元宇宙裡去參加舞會?答案是不行,因為程式不相容,因此未來不同公司開發的元宇宙具有相容性,才能串連成大一統的元宇宙。 目前元宇宙的發展還在第一階段,未來還有無限可能,元宇宙大爆發,臉書創辦人說:「元宇宙就是下一世代的網際網路。」就是這個意思。

由於目前臉書營運面臨瓶頸,因此開始啟動轉型,將「臉書 (Facebook) 」改名為「超越 (Meta) 」;輝達 (Nvidia) 執行長說:「元宇宙的經濟規模終將大過實體世界。」由於虛擬世界 3D 建模需要大量的圖形處理器 (GPU),將為輝達帶來另一波成長動能。我們在思考元宇宙時必須跳脫線上遊戲的思維,發展成創意發想平台、互動社交平台。

建成虛擬世界。圖/envatoelements

科技業界爆紅:元宇宙將主宰全宇宙?

Roundhill 投資公司預估 2030 年元宇宙產值高達 2.5 兆美元,這個數字可能有些誇大,但是確實代表元宇宙未來有不小的市場。事實上,未來元宇宙的重度使用者,主要還是目前網路遊戲的使用者,因此要估計元宇宙的市場,可以從目前的遊戲市場著手。

目前全球的遊戲市場每年有超過 2,500 億美元的商機,等於未來 8 年要成長大約 10 倍,如果我們把建立元宇宙所需要的資料中心所有硬體成本都計算進去,的確有可能達到這個規模。除了科技大廠躍躍欲試,為什麼連金融業、精品業也擁抱元宇宙?

-----廣告,請繼續往下閱讀-----

大家想想,要建立一個能夠容納全球數十億玩家的虛擬世界,而且現在大家對畫質與 3D 影像的品質要求愈來愈高,需要加蓋許多資料中心,包括:雲端伺服器、中央處理器 (CPU)、圖形處理器 (GPU)、儲存元件 (DDR/SSD);使用者連線需要各種網路設備與終端裝置,包括:網通設備、光纖通訊、第五代行動電話 (5G) 與物聯網 (IoT)、虛擬實境 (VR) 與擴增實境 (AR) 眼鏡、平面顯示器、智慧型手機、個人電腦等,顯然會給科技產業帶來巨大的商機。

在元宇宙消費。圖/envatoelements

此外,玩家在元宇宙裡需要線上消費、因此需要虛擬信用卡,金融業就有參與的角色;加密貨幣在真實世界裡就是個圈錢的龐氏騙局,都可以炒作到天價,在元宇宙的虛擬世界裡,怎麼可能放過這個炒作的機會?在真實世界裡我買不起愛馬仕的包包、鞋子、項鍊、耳環等各種精品,在虛擬世界裡不就可以買了嗎?因此精品業就有參與的角色。

在真實世界裡,我住狹窄的公寓、開國產轎車,在虛擬世界裡就可以住豪宅、開法拉利跑車;在真實世界裡,我是個員工每天被老闆罵,在虛擬世界裡我就是老闆可以罵員工;在真實世界裡,想搭SpaceX的太空飛船去火星「貴森森」我付不起,在虛擬世界裡我當然可以去星際旅遊跑遍全宇宙,甚至元宇宙會提供某些工作,所以未來可能有人在真實世界沒有工作,是進入虛擬世界上班的。

總之當我們在思考元宇宙時,不要被限制在現有的網路世界裡,請發揮你的想像力!

-----廣告,請繼續往下閱讀-----

——本文摘自《加密貨幣的真相:揭穿區塊鏈無本金融的國王新衣》,2022 年 1 1月,先覺出版,未經同意請勿轉載。

所有討論 1
先覺出版
2 篇文章 ・ 1 位粉絲

0

0
0

文字

分享

0
0
0
虛擬試衣間! virtual dressing room
Scimage
・2011/07/13 ・419字 ・閱讀時間少於 1 分鐘 ・SR值 481 ・五年級

融合虛擬與真實影像常常帶來新的應用,之前介紹過虛擬化妝模擬器就是一例。這次的影片是介紹虛擬試衣間,像是kinect之類的及時動作捕捉技術的成熟。目前已經有簡單的方案把即時的人體影像轉成電腦立體模型,這也意味著可以利用電腦的計算能力及時把各種不同的虛擬物件直接跟人體模型互動。

影片中介紹的是可以把想要試穿的衣服、皮包、配件等直接在電腦裡試穿,讓一些可能的搭配直接呈現出來。雖然系統還不完美,不過接下來幾年一定會改善。這樣的技術或許在以後的網路衣物購物上,能幫消費者做出更好的購買判斷。

影片中最後也展示了可以模擬穿著衣物滑雪的模樣,當然同樣類型的虛擬場景也可以利用像是電視製作或是舞台表演的場合。這些都是接近成熟的技術了,之後就等待有創意的朋友來找到更合適的應用跟發揮想像了!

本文原發表於 Scimage 科學影像 [2011. 7. 12]

-----廣告,請繼續往下閱讀-----
文章難易度
Scimage
113 篇文章 ・ 4 位粉絲
每日介紹科學新知, 科普知識與實際實驗影片-歡迎每一顆好奇的心 @_@!

2

7
0

文字

分享

2
7
0
讓人工智慧為 VTuber 團隊撐腰!——AI幫你一鍵生成虛擬音樂家!
研之有物│中央研究院_96
・2021/11/03 ・5051字 ・閱讀時間約 10 分鐘

本文轉載自中央研究院研之有物,泛科學為宣傳推廣執行單位。

  • 採訪撰文│林承勳
  • 美術設計│林洵安

自動化音樂展演的可能性

人工智慧(簡稱 AI)技術日新月異,不只打敗人類圍棋高手,現在更用在醫療、交通、金融、資安各領域,遍佈了你我的日常生活。中央研究院資訊科學研究所副研究員蘇黎讓 AI 又多了一項新技能:自動化音樂展演。「虛擬音樂家系統」創造出具有動畫形象的虛擬人物,配合真人一同演出,而且演奏動畫和音樂伴奏皆可自動產生。未來,經營 VTuber(虛擬 YouTuber)背後可能不再需要龐大製作團隊,只要專注在企劃和劇本,其他讓 AI 幫你一鍵生成!

蘇黎與研究團隊開發的虛擬音樂家系統。圖/研之有物、Unsplash(資料來源:蘇黎)

真實與虛擬合奏的貝多芬小提琴奏鳴曲

虛擬音樂家系統,這是蘇黎與其團隊最近的研究成果,他將 AI 應用到音樂表演現場,並試圖推展到整個多媒體產業。這套系統已實際在舞台演示,並與多個音樂展演團隊合作,包括:沛思文教基金會、清大 AI 樂團、長笛家林怡君、口口實驗室等。

以近年蘇黎舉辦的音樂會為例,主要可分為兩部分,一個是台上親手彈奏著貝多芬〈春〉第一樂章伴奏部分的真人鋼琴家;另一個,即為該場演奏的特別之處:正在螢幕裡演奏主旋律的虛擬小提琴音樂家。這場表演是人類與「虛擬音樂家系統」的巧妙組合,真人鋼琴家彈奏的過程中,虛擬音樂家系統除了負責合奏,同時還要生成螢幕上虛擬演奏者的動畫身影。

蘇黎與研究團隊公開展示真人音樂家與虛擬音樂家的合奏。圖/蘇黎(虛擬音樂家 Virtual Musician

不放槍、不搶拍的自動伴奏系統

虛擬音樂家系統的「自動伴奏」,不同於卡拉 OK 的機器伴奏,演奏者不需配合伴唱音樂,而是程式控制伴唱音樂以配合演奏者,讓演奏者自由詮釋樂曲。但因為要配合真人演出的現場發揮與不確定性,自動伴奏的運算必須又快又準。蘇黎指出,這也是研究中比較具有挑戰性的部分。

-----廣告,請繼續往下閱讀-----

自動伴奏系統的音樂偵測器、音樂追蹤器與位置估算單元,讓虛擬音樂家精準掌握真人演奏實況。

舉例來說,想要跟人合奏,首先要確定能同步開始,這個重責大任就由自動伴奏系統中的「音樂偵測器」擔綱。「音樂偵測器是偵測音樂什麼時候發出,但現場會有其他聲音,不可以讓機器聽到雜音就以為演奏開始了。」蘇黎說,因此團隊會先將整個樂譜,輸入到虛擬音樂家的自動伴奏系統中,並在演奏會場早早就讓系統持續待命,只要音樂偵測器偵測到樂譜的第一個音,伴奏隨即啟動。

自動伴奏系統在確認演奏開始之後,馬上又有另一項任務:追蹤音樂進度。因為每位音樂家會有自己的演奏風格,而且真人不管如何熟練,都還是有可能出現搶拍或延遲等變數。追蹤音樂進度的這項任務,便由自動伴奏系統中的「音樂追蹤器」和「位置估算單元」來執行。

「音樂追蹤器採用多執行緒線上動態時間校正(online dynamic time warping)演算法,每一個執行緒在最短時間內各自計算並取平均值,以找出最貼近該音樂家當下演奏速度的數值。」蘇黎解釋,追蹤器抓到現場演奏速度後拿來跟參考音樂檔案比對,就能推測多久後會演奏下一個音。至於位置估算單元,則是用來估計當下已演奏到整個樂譜的哪個位置。

虛擬音樂家系統藉由上述的自動伴奏技術,追蹤真人演奏進度,並自動觸發並演奏相應的聲部。目前團隊已經將偵測到觸發伴奏的平均延遲控制在 0.1 秒左右,但蘇黎的目標是要降低到「0.01」秒內。蘇黎表示,音樂心理學已證實,就算是沒有經過專業訓練的一般人,0.1 秒的誤差聽起來仍非常明顯,「延遲 0.01 秒可以勉強不引起業餘人士的注意;但面對專業音樂家時,延遲可能要到 0.001 秒左右才能過關。」

-----廣告,請繼續往下閱讀-----
自動伴奏系統可以即時追蹤音樂進度,判斷真人音樂家目前已經演奏到樂曲的哪個位置。圖/蘇黎(虛擬音樂家 Virtual Musician

訓練 AI 自動生成虛擬音樂家動畫形象

現場音樂表演是影音的雙重享受,所以虛擬音樂家除了擁有自動伴奏的「聲音」,還需要擁有將表演動作形象化的動畫「影像」。

真人音樂家演奏時,不論是情感的表達、與其他合奏者及觀眾互動、還有操作樂器的動作等,都存在個人差異,沒有一套固定標準。例如拉琴的手勢,10 個音樂家可以有 10 種不同的習慣。因此蘇黎與研究團隊採取的方法是:取得大量影音資料,讓 AI 學習如何製造虛擬音樂家的肢體動作。

首先,徵求多位專業小提琴演奏者,穿上有標記點的特殊衣服,站在有動態捕捉裝置的空間中,演奏不同風格曲目。蘇黎使用的 3D 動作偵測技術,會偵測音樂家全身骨骼的關節點,作為虛擬音樂家動畫生成的訓練資料,並在訓練動畫生成模型的過程中,重點關注持弓的右手如何移動。

透過 U 型網路、自注意力機制等核心技術,來輸出虛擬音樂家動態肢體影像。

在訓練 AI 與生成動畫影像的過程中,需要卷積神經網路來協助完成工作。蘇黎團隊採用的模型是 U 型網路(U-net),負責圖像之間的轉換,由編碼圖層傳到解碼圖層。它的優點是速度快,而且輸入輸出格式相對容易設計,能一次輸出大量資料點。「 U-net 可以一次輸出單一時間的所有肢體骨架點,而非一個一個骨架點逐步輸出。」蘇黎說。

-----廣告,請繼續往下閱讀-----
蘇黎與研究團隊採用 U 型網路模型訓練 AI,自動生成虛擬音樂家動畫影像。圖/蘇黎(Wu, Y. T., Chen, B., & Su, L. (2020)

除此之外,還有自注意力(self-attention)機制,讓 AI 學習判斷肢體動作與音樂的相關性。因為肢體動作跟音樂都是序列形式,有時間上的關聯性,假設真人音樂家某個動作在大鼓響起時一直出現,就會判定兩者存在關聯。之後自注意力機制在虛擬動作生成過程中,只要聽到該音樂的大鼓聲出現,就會發出明顯訊號,認為此時要搭配相應的肢體動作。

簡單來說,想要自動化生出虛擬小提琴家,不僅聲音要到位,動畫也要足夠精準。音樂需要自動伴奏系統,即時追蹤真人演奏者的進度並觸發伴奏;而相應的肢體動作,則有賴透過 U 型網路與自注意力機制,讓 AI 在音樂現場了解此時要搭配何種動作。

虛擬音樂家動畫的比較,左邊採用之前的研究,動作較不精準;中間是蘇黎團隊研究成果,自動生成的動畫骨架已有較多變化,並且右手拉弓動作較為準確;最右邊是符合真人動作的演奏動畫,需人工製作。圖/蘇黎(虛擬音樂家 Virtual Musician

進階挑戰:由聽覺到視覺的跨感官轉換

自動生成聲音和影像後,研究團隊還有一個更進階的目標。「我們想讓機器聽到某一首歌,就聯想到一幅畫。但坦白講,這種音樂到視覺風格轉換(music-to-visual style transfer)非常困難。」蘇黎說。當初有學生向他提出這個構想,想要訓練 AI 將音樂與畫面連結。只是這設定一開始就困難重重,因為最重要的訓練資料幾乎是無法取得。

AI 並非無中生有,機器學習有賴龐大、高品質的資料。

想要讓 AI 學習聽音樂聯想畫面,就必須要有真人示範,聆聽音樂並畫出心中所浮現的畫面來當作訓練資料。找人聽音樂不難,但找來的人未必善於繪畫;即使花大錢請畫家參與實驗,人少沒有代表性,人多則風格又可能大相逕庭。「演奏動作還有跡可循,但大家聽音樂腦補的畫面都不一樣,這樣是沒辦法當作訓練素材的。」蘇黎點出其中關鍵。

-----廣告,請繼續往下閱讀-----

研究團隊決定退而求其次,改成在一組音樂跟一組影像資料庫,透過兩者之間共享的語義標註(labels),試圖建立起對應關係。就像是電腦在連連看,如果配對起來共通點還算合理就成功。此時問題又來了,所謂「合理」實在難以界定,於是執行標準只好再一次降低,音樂與畫面的共同標註越簡單越好。

「雖然這跟當初想像中的差距非常大,但目前我們也只能用創作年代來當標註。」蘇黎說,經由創作年代這個共同標註,電腦聽到 1800 年的樂曲就會連到同樣年代的圖畫。即使不符原本理想,模型建立起來後,在虛擬音樂家系統裡還是可以發揮一些功能,像是為演奏會搭配符合音樂年代的背景畫面,或色彩效果。

蘇黎團隊風格轉換的案例,透過共享語義標註,在電腦聽到印象樂派作曲家德布西的音樂(Sarabande in Pour le piano, L. 95(1901))之後,原本為巴比松畫派的圖像(The Lake Her Lone Bosom Expands to the Sky(1850)),會轉換成印象畫派風格。圖/蘇黎(Crossing You in Style

如何成為音樂資訊研究者?

在虛擬音樂家系統之前,蘇黎與實驗室團隊(音樂與文化科技實驗室)在自動音樂採譜方面的研究已經有豐厚成果,他們研發出開源工具《Omnizart》。

《Omnizart》是音樂與文化科技實驗室研究成果集大成的實用開源工具。

它具備當前全世界最多樣樂器組合的分析功能,只要輸入一段音樂,不管是鋼琴獨奏、多重樂器、打擊樂,還是和弦辨識、節拍偵測,甚至是困難的人聲處理,都會幫你分析。

-----廣告,請繼續往下閱讀-----

「像鋼琴這類樂器的話,是音樂進去《Omnizart》,生出 MIDI;而人聲進去會輸出成供電腦判讀的數位資料。」蘇黎解釋,透過這些數字化的音訊數據能了解每一瞬間的音高變化,或是泛音、抖音等手法。研究自動採譜 AI 是因為,蘇黎想探究如蕭邦的夜曲等,這些百年來不斷被重複演奏超過千百次的古典樂,在不同時代、風格迥異的音樂家手中究竟是如何被詮釋。

而這次蘇黎用 AI 創造虛擬音樂家系統,同樣也是源於本身對音樂的喜愛與好奇。不是科班出身的他能彈奏鋼琴、吉他,會吹小號,喜歡聽經典的古典樂。對蘇黎來說,興趣是驅使研究向前的一大動力,他認為身為研究者必須要時常探索新的領域,因此常會要求自己不斷接觸世界各國的在地歌謠。

蘇黎的下一步,是以現有虛擬音樂家系統為基礎,加入更多細膩動作(例如臉部表情)的虛擬多人樂團。他也坦言目前自動伴奏系統、肢體生成還有風格轉換這三項技術,都還有很大的進步空間。想訓練電腦產生出更貼近真人演奏者動作的虛擬音樂家,必須花大量人力取得更多影片資料。「民眾常以為不用多做什麼 AI 就會自己學習,但真相是沒有夠好的資料什麼都不用談。」蘇黎解釋,AI 研究者的時間幾乎都耗在蒐集資料上。

同時,研究室也在規劃下一場發表。蘇黎認為,實體演奏會是考驗研究品質最好的方式。除了訓練好模型,現場還有很多要克服的變數,像是很多音樂廳沒有網路,團隊必須將整場演奏會所需的模型,事先設計成用一台筆電就能執行。「總不可能演奏到一半,資料量太大電腦跑不動,然後要跑出去連網路吧。」蘇黎笑著說,音樂會現場要面對很多做研究時不曾碰到的狀況,是很刺激、有挑戰性的任務。

-----廣告,請繼續往下閱讀-----

AI 將是未來主流,是好、是壞終究取決於人心。

AI 出現之後,自然也面臨許多批判,例如工作是否會被 AI 取代,甚至以 AI 操控虛假言論或用在軍事用途,但蘇黎覺得,主導權終究還是躲在背後操作的「人」。同樣,隨著虛擬音樂家系統日漸完善,真人音樂家是否擔心未來飯碗被搶走?令人意外的是,蘇黎說身邊最期待這個系統的反而就是與他合作的藝術家,「別小看他們,藝術家可是一群勇敢、期待新事物、信仰未來的人。」

蘇黎未來研究方向是以現有虛擬音樂家系統為基礎,再加入更多細膩動作的虛擬多人樂團。他坦言目前自動伴奏系統、肢體生成還有風格轉換這三項技術,都還有很大的進步空間。圖/研之有物

延伸閱讀:

所有討論 2
研之有物│中央研究院_96
293 篇文章 ・ 3356 位粉絲
研之有物,取諧音自「言之有物」,出處為《周易·家人》:「君子以言有物而行有恆」。探索具體研究案例、直擊研究員生活,成為串聯您與中研院的橋梁,通往博大精深的知識世界。 網頁:研之有物 臉書:研之有物@Facebook