0

0
0

文字

分享

0
0
0

大數據與人道援助 – 群眾標記應用

活躍星系核_96
・2015/02/26 ・3496字 ・閱讀時間約 7 分鐘 ・SR值 598 ・九年級

作者:潘人豪助理教授,元智大學大數據與數位匯流創新中心

「人道援助」,乍聽這個詞,或許大家腦海中浮出的,是穿著白袍的醫生坐在簡陋環境裡義診,也可能是大批穿著制服協助難民撤逃的軍人們,又或者是寫著UN(United Nations)聯合國的白色四輪驅動越野車奔馳在災區中進行調查支援。有沒有曾經想像過,雲端計算、大數據應用,這樣的前端資通訊技術,也有可能應用在人道援助的場域中呢?

這幾年雲端技術、大數據應用的蓬勃發展,早已深入每一個人日常生活中,更不用說在各個商業領域的前端應用。然而在這樣全球火熱且全面關注的議題中,卻鮮少有人意識到,大數據也同時悄悄的應用到人道援助、國際合作領域中。

每當我們撥出一通電話、購買某個商品、使用社群媒體,甚至僅僅打開網頁瀏覽,都在不知不覺中產生大量資訊,加上自動化感測裝置的連續資料,無論是從政府單位或是私人企業產生儲存,這些無數的大數據資訊源與其交互組合可解釋的問題幾乎可以涵蓋各種議題,而當今的人道援助、國際合作機構,便是企圖利用各種大數據資訊或雲端計算科技,解決當下所面臨的問題,給予目標族群(vulnerable communities)更快速、有效的援助服務。

-----廣告,請繼續往下閱讀-----

然而對於這樣的大數據、雲端服務應用,其實並不是近幾年大數據技術流行才有的,早在2007年,位於東非的肯亞(Kenya)共和國因為俱爭議總統大選後的全國性暴動,種族對立衝突造成超過一千三百人喪生與三十五萬人被迫離開家園躲避內亂。

政府軍隊進行武力鎮壓 (Photo: Evelyn Hockstein, The New York Times)
政府軍隊進行武力鎮壓 (Photo: Evelyn Hockstein, The New York Times   )
肯亞國內Kikuyu 族群民眾抗爭(Photo : Evelyn Hockstein, The New York Times)
肯亞國內Kikuyu 族群民眾抗爭(Photo : Evelyn Hockstein, The New York Times

而在肯亞內亂當時,一群當地程式設計師與網路團體開發出名為Ushahidi計畫,Ushahidi為肯亞當地Swahili語言的證言(testimony)之意,Ushahidi計畫發展出一個網路平台,使用者可以透過手機SMS(Short Message Service)簡訊或網站進行暴力事件通報,隨後Ushahidi平台利用Google map進行地理位置標定,藉此跳脫國內媒體受控制或失去機能的狀態,直接由人民發聲向國際尋求援助,也因為Ushahidi的通報與傳播,國際組織得以快速動員進行人道援助救援與物資提供。

2008年後Ushahida計畫也擴展為國際人道援助平台,企圖提供全球進行事件通報與群眾標記(crowdmapping),並運用於諸多國家,如美國亞特蘭大(Atlanta)犯罪事件追蹤、印度(Republic of India)與墨西哥(United Mexican States)選舉結果的提報追蹤,甚至是2010年海地(Republic of Haiti)大地震與2011年日本東北大地震(2011 Tōhoku earthquake and tsunami)的事件追蹤標記。

2011年日本東北大地震Ushahidi應用(圖片來源:livedoor news) 右圖:Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools)
2011年日本東北大地震Ushahidi應用(圖片來源:livedoor news
Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools)
Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools

此外針對急難應用與災害救援事件,Google藉由其所擁有的計算資源,結合其自家Google App Engine分散計算引擎與儲存架構,以及Picasa 影像平台,於2010年時針對中美洲海地地震提出了Google Person Finder服務,針對災區進行災民尋找與通報服務;該服務後續亦提供之後2010智利(Chile)大地震、2011年日本東北大地震,甚至是前年(2013)於菲律賓造成嚴重災情的海燕颱風等災害救援。而Google Person Finder在2011年日本東北大地震期間曾創下高達六十萬姓名資訊紀錄的規模,堪為短時間內人道援助資訊蒐集彙整之成功案例。

-----廣告,請繼續往下閱讀-----
2010 海地大地震時Google推出之Person Finder服務 (Image from : Wikipedia)
2010 海地大地震時Google推出之Person Finder服務
(Image from : Wikipedia

同樣透過大數據群眾標記進行人道救援案例,還有哈佛醫學院Rumi學者,透過社群媒體進行對傳染疾病傳播於地理位置擴散標定的流行病學研究,該研究發表於2012年American Journal of Tropical Medicine and Hygiene期刊,該作者透過自動網路媒體調查平台HealthMap,針對海地自2010年10月20號爆發霍亂(Cholera)疫情開始100天,紀錄由網路平台HealthMap、Twitter所產生之社群網路與關鍵字”Cholera”相關訊息,並透過訊息自動標定其地理位置,藉由時間推演與地理資訊標的,進一步對照海地政府公共衛生部(Ministère de la Santé Publique et de la Population, MSPP)提供之實際通報個案數據。

其結果發現網路數據的呈現與地理位置分布,符合MSPP所提供之事後通報個案資料分布與趨勢,證明透過社群媒體進行大數據資料探勘之方法,可以以低成本的方式進行傳染性疾病早期偵測,並達到快速反應與提早實施防疫策略之使用,針對醫療發展落後、醫療資訊蒐集傳遞機制不健全之國家 實為一個創新的應用。

Rumi學者透過社群媒體數據所獲得之禍亂發生、擴散分布圖。 (圖片來源  doi:10.4269/ajtmh.2012.11-0597)
Rumi學者透過社群媒體數據所獲得之禍亂發生、擴散分布圖。
(圖片來源 doi:10.4269/ajtmh.2012.11-0597

發展中國家的公共衛生改善與發展,直接影響該國家人民的生存條件與健康條件,目前各國雖透過社群媒體大數據探勘技術企圖進行早期偵測,但如同文獻與相關報導中所提及,因為城鄉差異過大,資訊能力素養不齊,資料過度集中於高人口密度區域如首都太子港(Port-au-Prince)造成評估上的誤差與偏鄉地區的低估。

2014.02 筆者於Saint-Michel-de-l'Attalaye地區拍攝之霍亂隔離病房
2014.02 筆者於Saint-Michel-de-l’Attalaye地區拍攝之霍亂隔離病房
2014.07 筆者重返Saint-Michel-de-l'Attalaye地區, 該區正爆發霍亂疫情病患擠滿霍亂隔離病房(因病患隱私,未拍攝內部照片)
2014.07 筆者重返Saint-Michel-de-l’Attalaye地區,
該區正爆發霍亂疫情病患擠滿霍亂隔離病房(因病患隱私,未拍攝內部照片)

上述之偏差狀況,由筆者近幾年數度至海地進行人道援助計畫時可得到驗證,今年七月筆者與桃園醫院國際衛生中心再度訪問海地北部Artibonite省之偏鄉Saint-Michel-de-l’Attalaye地區時,遭遇該區域爆發嚴重霍亂疫情,然而時隔2010初次爆發至今已將近三年之久,卻仍無法有效控制疫情散布,原因除了當地缺乏公共衛生工程礎建設、民眾公共衛生教育素養不足外,當地醫療機構僅使用紙本文件進行病患診斷紀錄,缺乏病患追蹤、主動式訊息通報機制,導致衛生單位無法立即獲取第一手疾病資訊以進行疫情防堵,亦是主要原因之一。

-----廣告,請繼續往下閱讀-----

因此如何導入全國醫療資訊傳遞網路,由政府端建立真正醫療大數據平台,進行即時傳染性疾病事件通報、監控、追蹤機制,才是治標治本之道。

2014.07 筆者與桃園醫院國際衛生中心 於海地衛生部(MSPP)進行醫療資訊應用課程
2014.07 筆者與桃園醫院國際衛生中心 於海地衛生部(MSPP)進行醫療資訊應用課程

大數據小辭典:

  • 群眾外包(crowdsourcing):此為《連線》(Wired)雜誌記者Jeff Howe於2006年發明的一個專業術語,用來描述一種新的商業模式透過網際網路上的使用者所組成的群體,進行創意的發想、工作執行與技術問題解決等。參與群眾外包成員,針對特定執行項目大多僅收取小額報酬或無償提供服務,因此建立了一種新的勞動結構。
  • 群眾標記(crowdmapping):透過網際網路、行動裝置,群眾使用者可以於平台上標記任何虛擬化事件資訊,包含文字、影像、視訊多媒體、地理資訊、健康醫療紀錄等等,為群眾外包 (crowdsourcing)的延伸應用。常見的群眾標記服務多與地理資訊系統整合,提供具備地理位址之事件資訊。
  • 社群網路(Social Network):是為一群擁有相同興趣與活動的人連結而成的線上社群。針對這類社群所提供的類服務往往是基於網際網路並為用戶提供各種聯繫、交流的互動通路,如電子信件、即時訊息服務或線上網路平台等。常見社群網路平台Facebook, Twitter, Plurk, Google+, LinkedIn, 人人網, 新浪微博, 騰訊微博, Instagram等等。
  • 社群媒體資料探勘(Social Media Mining):社群媒體資料探勘是透過針對社群網物所產生的資料,所進行的資訊擷取、彙整、分析,企圖取得特殊目的、族群的目標模式,透過統計方法、機器學習、網站分析、網路科學等等不同領域的方法,進行對社群網路資料所產生的龐大數據資料尋找其有意義的應用資訊與現象。
  • 社群網路分析 (Social Network Analysis):有別於社群媒體資料探勘,社群網路分析主要過社群網路上每個使用者與其彼此間的關聯性透過電腦科學中的圖學理論、網路理論,將社群網路的事件關聯轉化為圖學上的節點與線段連接,藉此便可以使用數據分析方法中針對圖學、網路關聯分析技術進行判斷,找出其中的群聚、分類、特殊事件與趨勢等標的。

想了解更多大數據知識,歡迎訂閱元智大學大數據匯流電子報

文章難易度
活躍星系核_96
752 篇文章 ・ 126 位粉絲
活躍星系核(active galactic nucleus, AGN)是一類中央核區活動性很強的河外星系。這些星系比普通星系活躍,在從無線電波到伽瑪射線的全波段裡都發出很強的電磁輻射。 本帳號發表來自各方的投稿。附有資料出處的科學好文,都歡迎你來投稿喔。 Email: contact@pansci.asia

0

3
3

文字

分享

0
3
3
圖形處理單元與人工智慧
賴昭正_96
・2024/06/24 ・6944字 ・閱讀時間約 14 分鐘

  • 作者/賴昭正|前清大化學系教授、系主任、所長;合創科學月刊

我擔心人工智慧可能會完全取代人類。如果人們能設計電腦病毒,那麼就會有人設計出能夠自我改進和複製的人工智慧。 這將是一種超越人類的新生命形式。

——史蒂芬.霍金(Stephen Hawking) 英國理論物理學家

大約在八十年前,當第一台數位計算機出現時,一些電腦科學家便一直致力於讓機器具有像人類一樣的智慧;但七十年後,還是沒有機器能夠可靠地提供人類程度的語言或影像辨識功能。誰又想到「人工智慧」(Artificial Intelligent,簡稱 AI)的能力最近十年突然起飛,在許多(所有?)領域的測試中擊敗了人類,正在改變各個領域——包括假新聞的製造與散佈——的生態。

圖形處理單元(graphic process unit,簡稱 GPU)是這場「人工智慧」革命中的最大助手。它的興起使得九年前還是個小公司的 Nvidia(英偉達)股票從每股不到 $5,上升到今天(5 月 24 日)每股超過 $1000(註一)的全世界第三大公司,其創辦人(之一)兼首席執行官、出生於台南的黃仁勳(Jenson Huang)也一躍成為全世界排名 20 內的大富豪、台灣家喻戶曉的名人!可是多少人了解圖形處理單元是什麼嗎?到底是時勢造英雄,還是英雄造時勢?

黃仁勳出席2016年台北國際電腦展
Nvidia 的崛起究竟是時勢造英雄,還是英雄造時勢?圖/wikimedia

在回答這問題之前,筆者得先聲明筆者不是學電腦的,因此在這裡所能談的只是與電腦設計細節無關的基本原理。筆者認為將原理轉成實用工具是專家的事,不是我們外行人需要了解的;但作為一位現在的知識分子或公民,了解基本原理則是必備的條件:例如了解「能量不滅定律」就可以不用仔細分析,即可判斷永動機是騙人的;又如現在可攜帶型冷氣機充斥市面上,它們不用往室外排廢熱氣,就可以提供屋內冷氣,讀者買嗎?

CPU 與 GPU

不管是大型電腦或個人電腦都需具有「中央處理單元」(central process unit,簡稱 CPU)。CPU 是電腦的「腦」,其電子電路負責處理所有軟體正確運作所需的所有任務,如算術、邏輯、控制、輸入和輸出操作等等。雖然早期的設計即可以讓一個指令同時做兩、三件不同的工作;但為了簡單化,我們在這裡所談的工作將只是執行算術和邏輯運算的工作(arithmetic and logic unit,簡稱 ALU),如將兩個數加在一起。在這一簡化的定義下,CPU 在任何一個時刻均只能執行一件工作而已。

-----廣告,請繼續往下閱讀-----

在個人電腦剛出現只能用於一般事物的處理時,CPU 均能非常勝任地完成任務。但電腦圖形和動畫的出現帶來了第一批運算密集型工作負載後,CPU 開始顯示心有餘而力不足:例如電玩動畫需要應用程式處理數以萬計的像素(pixel),每個像素都有自己的顏色、光強度、和運動等, 使得 CPU 根本沒辦法在短時間內完成這些工作。於是出現了主機板上之「顯示插卡」來支援補助 CPU。

1999 年,英偉達將其一「具有集成變換、照明、三角形設定/裁剪、和透過應用程式從模型產生二維或三維影像的單晶片處理器」(註二)定位為「世界上第一款 GPU」,「GPU」這一名詞於焉誕生。不像 CPU,GPU 可以在同一個時刻執行許多算術和邏輯運算的工作,快速地完成圖形和動畫的變化。

依序計算和平行計算

一部電腦 CPU 如何計算 7×5+6/3 呢?因每一時刻只能做一件事,所以其步驟為:

  • 計算 7×5;
  • 計算 6/3;
  • 將結果相加。

總共需要 3 個運算時間。但如果我們有兩個 CPU 呢?很多工作便可以同時(平行)進行:

-----廣告,請繼續往下閱讀-----
  • 同時計算 7×5 及 6/3;
  • 將結果相加。

只需要 2 個運算時間,比單獨的 CPU 減少了一個。這看起來好像沒節省多少時間,但如果我們有 16 對 a×b 要相加呢?單獨的 CPU 需要 31 個運算的時間(16 個 × 的運算時間及 15 個 + 的運算時間),而有 16 個小 CPU 的 GPU 則只需要 5 個運算的時間(1 個 × 的運算時間及 4 個 + 的運算時間)!

現在就讓我們來看看為什麼稱 GPU 為「圖形」處理單元。圖一左圖《我愛科學》一書擺斜了,如何將它擺正成右圖呢? 一句話:「將整個圖逆時針方向旋轉 θ 即可」。但因為左圖是由上百萬個像素點(座標 x, y)組成的,所以這句簡單的話可讓 CPU 忙得不亦樂乎了:每一點的座標都必須做如下的轉換

x’ = x cosθ + y sinθ

y’ = -x sinθ+ y cosθ

-----廣告,請繼續往下閱讀-----

即每一點均需要做四個 × 及兩個 + 的運算!如果每一運算需要 10-6 秒,那麼讓《我愛科學》一書做個簡單的角度旋轉,便需要 6 秒,這豈是電動玩具畫面變化所能接受的?

圖形處理的例子

人類的許多發明都是基於需要的關係,因此電腦硬件設計家便開始思考:這些點轉換都是獨立的,為什麼我們不讓它們同時進行(平行運算,parallel processing)呢?於是專門用來處理「圖形」的處理單元出現了——就是我們現在所知的 GPU。如果一個 GPU 可以同時處理 106 運算,那上圖的轉換只需 10-6 秒鐘!

GPU 的興起

GPU 可分成兩種:

  • 整合式圖形「卡」(integrated graphics)是內建於 CPU 中的 GPU,所以不是插卡,它與 CPU 共享系統記憶體,沒有單獨的記憶體組來儲存圖形/視訊,主要用於大部分的個人電腦及筆記型電腦上;早期英特爾(Intel)因為不讓插卡 GPU 侵蝕主機的地盤,在這方面的研發佔領先的地位,約佔 68% 的市場。
  • 獨立顯示卡(discrete graphics)有不與 CPU 共享的自己專用內存;由於與處理器晶片分離,它會消耗更多電量並產生大量熱量;然而,也正是因為有自己的記憶體來源和電源,它可以比整合式顯示卡提供更高的效能。

2007 年,英偉達發布了可以在獨立 GPU 上進行平行處理的軟體層後,科學家發現獨立 GPU 不但能夠快速處理圖形變化,在需要大量計算才能實現特定結果的任務上也非常有效,因此開啟了為計算密集型的實用題目編寫 GPU 程式的領域。如今獨立 GPU 的應用範圍已遠遠超出當初圖形處理,不但擴大到醫學影像和地震成像等之複雜圖像和影片編輯及視覺化,也應用於駕駛、導航、天氣預報、大資料庫分析、機器學習、人工智慧、加密貨幣挖礦、及分子動力學模擬(註三)等其它領域。獨立 GPU 已成為人工智慧生態系統中不可或缺的一部分,正在改變我們的生活方式及許多行業的遊戲規則。英特爾在這方面發展較遲,遠遠落在英偉達(80%)及超微半導體公司(Advance Micro Devices Inc.,19%,註四)之後,大約只有 1% 的市場。

-----廣告,請繼續往下閱讀-----
典型的CPU與GPU架構

事實上現在的中央處理單元也不再是真正的「單元」,而是如圖二可含有多個可以同時處理運算的核心(core)單元。GPU 犧牲大量快取和控制單元以獲得更多的處理核心,因此其核心功能不如 CPU 核心強大,但它們能同時高速執行大量相同的指令,在平行運算中發揮強大作用。現在電腦通常具有 2 到 64 個核心;GPU 則具有上千、甚至上萬的核心。

結論

我們一看到《我愛科學》這本書,不需要一點一點地從左上到右下慢慢掃描,即可瞬間知道它上面有書名、出版社等,也知道它擺斜了。這種「平行運作」的能力不僅限於視覺,它也延伸到其它感官和認知功能。例如筆者在清華大學授課時常犯的一個毛病是:嘴巴在講,腦筋思考已經不知往前跑了多少公里,常常為了追趕而越講越快,將不少學生拋到腦後!這不表示筆者聰明,因為研究人員發現我們的大腦具有同時處理和解釋大量感官輸入的能力。

人工智慧是一種讓電腦或機器能夠模擬人類智慧和解決問題能力的科技,因此必須如人腦一樣能同時並行地處理許多資料。學過矩陣(matrix)的讀者應該知道,如果用矩陣和向量(vector)表達,上面所談到之座標轉換將是非常簡潔的(註五)。而矩陣和向量計算正是機器學習(machine learning)演算法的基礎!也正是獨立圖形處理單元最強大的功能所在!因此我們可以了解為什麼 GPU 會成為人工智慧開發的基石:它們的架構就是充分利用並行處理,來快速執行多個操作,進行訓練電腦或機器以人腦之思考與學習的方式處理資料——稱為「深度學習」(deep learning)。

黃仁勳在 5 月 22 日的發布業績新聞上謂:「下一次工業革命已經開始了:企業界和各國正與英偉達合作,將價值數萬億美元的傳統資料中心轉變為加速運算及新型資料中心——人工智慧工廠——以生產新商品『人工智慧』。人工智慧將為每個產業帶來顯著的生產力提升,幫助企業降低成本和提高能源效率,同時擴大收入機會。」

附錄

人工智慧的實用例子:下面一段是微軟的「copilot」代書、谷歌的「translate」代譯之「one paragraph summary of GPU and AI」。讀完後,讀者是不是認為筆者該退休了?

-----廣告,請繼續往下閱讀-----

GPU(圖形處理單元)和 AI(人工智慧)之間的協同作用徹底改變了高效能運算領域。GPU 具有平行處理能力,特別適合人工智慧和機器學習所需的複雜資料密集運算。這導致了影像和視訊處理等領域的重大進步,使自動駕駛和臉部辨識等技術變得更加高效和可靠。NVIDIA 開發的平行運算平台 CUDA 進一步提高了 GPU 的效率,使開發人員能夠透過將人工智慧問題分解為更小的、可管理的、可同時處理的任務來解決這些問題。這不僅加快了人工智慧研究的步伐,而且使其更具成本效益,因為 GPU 可以在很短的時間內執行與多個 CPU 相同的任務。隨著人工智慧的不斷發展,GPU 的角色可能會變得更加不可或缺,推動各產業的創新和新的可能性。大腦透過神經元網路實現這一目標,這些神經元網路可以獨立但有凝聚力地工作,使我們能夠執行複雜的任務,例如駕駛、導航、觀察交通信號、聽音樂並同時規劃我們的路線。此外,研究表明,與非人類動物相比,人類大腦具有更多平行通路,這表明我們的神經處理具有更高的複雜性。這個複雜的系統證明了我們認知功能的卓越適應性和效率。我們可以一邊和朋友聊天一邊走在街上,一邊聽音樂一邊做飯,或一邊聽講座一邊做筆記。人工智慧是模擬人類腦神經網路的科技,因此必須能同時並行地來處理許多資料。研究人員發現了人腦通訊網路具有一個在獼猴或小鼠中未觀察獨特特徵:透過多個並行路徑傳輸訊息,因此具有令人難以置信的多任務處理能力。

註解

(註一)當讀者看到此篇文章時,其股票已一股換十股,現在每一股約在 $100 左右。

(註二)組裝或升級過個人電腦的讀者或許還記得「英偉達精視 256」(GeForce 256)插卡吧?

(註三)筆者於 1984 年離開清華大學到 IBM 時,就是參加了被認為全世界使用電腦時間最多的量子化學家、IBM「院士(fellow)」Enrico Clementi 的團隊:因為當時英偉達還未有可以在 GPU 上進行平行處理的軟體層,我們只能自己寫軟體將 8 台中型電腦(非 IBM 品牌!)與一大型電腦連接來做平行運算,進行分子動力學模擬等的科學研究。如果晚生 30 年或許就不會那麼辛苦了?

-----廣告,請繼續往下閱讀-----

(註四)補助個人電腦用的 GPU 品牌到 2000 年時只剩下兩大主導廠商:英偉達及 ATI(Array Technology Inc.)。後者是出生於香港之四位中國人於 1985 年在加拿大安大略省成立,2006 年被超微半導體公司收購,品牌於 2010 年被淘汰。超微半導體公司於 2014 年 10 月提升台南出生之蘇姿豐(Lisa Tzwu-Fang Su)博士為執行長後,股票從每股 $4 左右,上升到今天每股超過 $160,其市值已經是英特爾的兩倍,完全擺脫了在後者陰影下求生存的小眾玩家角色,正在挑戰英偉達的 GPU 市場。順便一題:超微半導體公司現任總裁(兼 AI 策略負責人)為出生於台北的彭明博(Victor Peng);與黃仁勳及蘇姿豐一樣,也是小時候就隨父母親移居到美國。

(註五)

延伸閱讀

  • 熱力學與能源利用」,《科學月刊》,1982 年 3 月號;收集於《我愛科學》(華騰文化有限公司,2017 年 12 月出版),轉載於「嘉義市政府全球資訊網」。
  • 網路安全技術與比特幣」,《科學月刊》,2020 年 11 月號;轉載於「善科教育基金會」的《科技大補帖》專欄。
文章難易度

討論功能關閉中。

賴昭正_96
43 篇文章 ・ 56 位粉絲
成功大學化學工程系學士,芝加哥大學化學物理博士。在芝大時與一群留學生合創「科學月刊」。一直想回國貢獻所學,因此畢業後不久即回清大化學系任教。自認平易近人,但教學嚴謹,因此穫有「賴大刀」之惡名!於1982年時當選爲 清大化學系新一代的年青首任系主任兼所長;但壯志難酬,兩年後即辭職到美留浪。晚期曾回台蓋工廠及創業,均應「水土不服」而鎩羽而歸。正式退休後,除了開始又爲科學月刊寫文章外,全職帶小孫女(半歲起);現已成七歲之小孫女的BFF(2015)。首先接觸到泛科學是因爲科學月刊將我的一篇文章「愛因斯坦的最大的錯誤一宇宙論常數」推薦到泛科學重登。

2

3
0

文字

分享

2
3
0
數據塑造生活與社會,讓人既放心但又不安?——《 AI 世代與我們的未來》
聯經出版_96
・2022/12/28 ・2760字 ・閱讀時間約 5 分鐘

-----廣告,請繼續往下閱讀-----

數位世界已經改變了我們日常生活的體驗,一個人從早到晚都會接受到大量數據,受益於大量數據,也貢獻大量數據。這些數據龐大的程度,和消化資訊的方式已經太過繁多,人類心智根本無法處理。

與數位科技建立夥伴關係

所以人會本能地或潛意識地倚賴軟體來處理、組織、篩選出必要或有用的資訊,也就是根據用戶過去的偏好或目前的流行,來挑選要瀏覽的新項目、要看的電影、要播放的音樂。自動策劃的體驗很輕鬆容易,又能讓人滿足,人們只會在沒有自動化服務,例如閱讀別人臉書塗鴉牆上的貼文,或是用別人的網飛帳號看電影時,才會注意到這服務的存在。

有人工智慧協助的網路平臺加速整合,並加深了個人與數位科技間的連結。人工智慧經過設計和訓練,能直覺地解決人類的問題、掌握人類的目標,原本只有人類心智才能管理的各種選擇,現在能由網路平臺來引導、詮釋和記錄(儘管效率比較差)。

日常生活中很少察覺到對自動策劃的依賴。圖/Pexels

網路平臺收集資訊和體驗來完成這些任務,任何一個人的大腦在壽命期限內都不可能容納如此大量的資訊和體驗,所以網路平臺能產出看起來非常恰當的答案和建議。例如,採購員不管再怎麼投入工作,在挑選冬季長靴的時候,也不可能從全國成千上萬的類似商品、近期天氣預測、季節因素、回顧過去的搜尋記錄、調查物流模式之後,才決定最佳的採購項目,但人工智慧可以完整評估上述所有因素。

-----廣告,請繼續往下閱讀-----

因此,由人工智慧驅動的網路平臺經常和我們每個人互動,但我們在歷史上從未和其他產品、服務或機器這樣互動過。當我們個人在和人工智慧互動的時候,人工智慧會適應個人用戶的偏好(網際網路瀏覽記錄、搜尋記錄、旅遊史、收入水準、社交連結),開始形成一種隱形的夥伴關係。

個人用戶逐漸依賴這樣的平臺來完成一串功能,但這些功能過去可能由郵政、百貨公司,或是接待禮賓、懺悔自白的人和朋友,或是企業、政府或其他人類一起來完成。

網路平臺和用戶之間是既親密又遠距的聯繫。圖/Envato Elements

個人、網路平臺和平臺用戶之間的關係,是一種親密關係與遠距聯繫的新穎組合。人工智慧網路平臺審查大量的用戶數據,其中大部分是個人數據(如位置、聯絡資訊、朋友圈、同事圈、金融與健康資訊);網路會把人工智慧當成嚮導,或讓人工智慧來安排個人化體驗。

人工智慧如此精準、正確,是因為人工智慧有能力可以根據數億段類似的關係,以及上兆次空間(用戶群的地理範圍)與時間(集合了過去的使用)的互動來回顧和反應。網路平臺用戶與人工智慧形成了緊密的互動,並互相學習。

-----廣告,請繼續往下閱讀-----

網路平臺的人工智慧使用邏輯,在很多方面對人類來說都難以理解。例如,運用人工智慧的網路平臺在評估圖片、貼文或搜尋時,人類可能無法明確地理解人工智慧會在特定情境下如何運作。谷歌的工程師知道他們的搜尋功能若有人工智慧,就會有清楚的搜尋結果;若沒有人工智慧,搜尋結果就不會那麼清楚,但工程師沒辦法解釋為什麼某些結果的排序比較高。

要評鑑人工智慧的優劣,看的是結果實用不實用,不是看過程。這代表我們的輕重緩急已經和早期不一樣了,以前每個機械的步驟或思考的過程都會由人類來體驗(想法、對話、管理流程),或讓人類可以暫停、檢查、重複。

人工智慧陪伴現代人的生活

例如,在許多工業化地區,旅行的過程已經不需要「找方向」了。以前這過程需要人力,要先打電話給我們要拜訪的對象,查看紙本地圖,然後常常在加油站或便利商店停下來,確認我們的方向對不對。現在,透過手機應用程式,旅行的過程可以更有效率。

透過導航,為旅途帶來不少便利。圖/Pexels

這些應用程式不但可以根據他們「所知」的交通記錄來評估可能的路線與每條路線所花費的時間,還可以考量到當天的交通事故、可能造成延誤的特殊狀況(駕駛過程中的延誤)和其他跡象(其他用戶的搜尋),來避免和別人走同一條路。

-----廣告,請繼續往下閱讀-----

從看地圖到線上導航,這轉變如此方便,很少人會停下來想想這種變化有多大的革命性意義,又會帶來什麼後果。個人用戶、社會與網路平臺和營運商建立了新關係,並信任網路平臺與演算法可以產生準確的結果,獲得了便利,成為數據集的一部分,而這數據集又在持續進化(至少會在大家使用應用程式的時候追蹤個人的位置)。

在某種意義上,使用這種服務的人並不是獨自駕駛,而是系統的一部分。在系統內,人類和機器智慧一起協作,引導一群人透過各自的路線聚集在一起。

持續陪伴型的人工智慧會愈來愈普及,醫療保健、物流、零售、金融、通訊、媒體、運輸和娛樂等產業持續發展,我們的日常生活體驗透過網路平臺一直在變化。

網路平台協助我們完成各種事項。圖/Pexels

當用戶找人工智慧網路平臺來協助他們完成任務的時候,因為網路平臺可以收集、提煉資訊,所以用戶得到了益處,上個世代完全沒有這種經驗。這種平臺追求新穎模式的規模、力量、功能,讓個人用戶獲得前所未有的便利和能力;同時,這些用戶進入一種前所未有的人機對話中。

-----廣告,請繼續往下閱讀-----

運用人工智慧的網路平臺有能力可以用我們無法清楚理解,甚至無法明確定義或表示的方式來形塑人類的活動,這裡有一個很重要的問題:這種人工智慧的目標功能是什麼?由誰設計?在哪些監管參數範圍裡?

類似問題的答案會繼續塑造未來的生活與未來的社會:誰在操作?誰在定義這些流程的限制?這些人對於社會規範和制度會有什麼影響?有人可以存取人工智慧的感知嗎?有的話,這人是誰?

如果沒有人類可以完全理解或查看數據,或檢視每個步驟,也就是說假設人類的角色只負責設計、監控和設定人工智慧的參數,那麼對人工智慧的限制應該要讓我們放心?還是讓我們不安?還是既放心又不安?

——本文摘自《 AI 世代與我們的未來:人工智慧如何改變生活,甚至是世界?》,2022 年 12 月,聯經出版公司,未經同意請勿轉載。

-----廣告,請繼續往下閱讀-----
所有討論 2
聯經出版_96
27 篇文章 ・ 20 位粉絲
聯經出版公司創立於1974年5月4日,是一個綜合性的出版公司,為聯合報系關係企業之一。 三十多年來已經累積了近六千餘種圖書, 範圍包括人文、社會科學、科技以及小說、藝術、傳記、商業、工具書、保健、旅遊、兒童讀物等。

0

1
0

文字

分享

0
1
0
AI 的 3 種學習形式:不同的目標功能,不同的訓練方式——《 AI 世代與我們的未來》
聯經出版_96
・2022/12/27 ・2368字 ・閱讀時間約 4 分鐘

搭配不同的任務,人工智慧的應用方式也不一樣,所以開發人員用來創造人工智慧的科技也不一樣。這是部署機器學習時最基礎的挑戰:不同的目標和功能需要不同的訓練技巧。

機器學習最基礎的挑戰:不同目標和功能需配合不同訓練技巧。圖/Pexels

不過,結合不同的機器學習法,尤其是應用神經網路,就出現不同的可能性,例如發現癌症的人工智慧。

機器的 3 種學習形式

在我們撰寫本章的時候,機器學習的三種形式:受監督式學習、不受監督式學習和增強式學習,都值得注意。

受監督式學習催生了發現海利黴素的人工智慧。總結來說,麻省理工學院的研究人員想要找出有潛力的新抗生素,在資料庫裡放入二千種分子來訓練模型,輸入項目是分子結構,輸出項目是抑菌效果;研究人員把分子結構展示給人工智慧看,每一種結構都標示抗菌力,然後讓人工智慧去評估新化合物的抗菌效果。

-----廣告,請繼續往下閱讀-----

這種技巧稱為受監督式學習,因為人工智慧開發人員利用包含了輸入範例(即分子結構)的資料集,在這裡面,每一筆數據都單獨標示研究人員想要的輸出項目或結果(即抗菌力)。

開發人員已經把受監督式學習的技巧應用於許多處,例如創造人工智慧來辨識影像。為了這項任務,人工智慧先拿已經標示好的圖像來訓練,學著把圖像和標籤,例如把貓的照片和「貓」的標籤,聯想在一起,人工智慧把圖片和標籤的關係編碼之後,就可以正確地辨識新圖片。

貓貓!圖/Pexels

因此,當開發人員有一個資料集,其中每個輸入項目都有期望的輸出項目,受監督式學習就能有效地創造出模型,根據新的輸入項目來預測輸出項目。

不過,當開發人員只有大量資料,沒有建立關係的時候,他們可以透過不受監督式學習來找出可能有用的見解。因為網際網路與資料數位化,比過去更容易取得資料,現在企業、政府和研究人員都被淹沒在資料中。

-----廣告,請繼續往下閱讀-----

行銷人員擁有更多顧客資訊、生物學家擁有更多資料、銀行家有更多金融交易記錄。當行銷人員想要找出客戶群,或詐騙分析師想要在大量交易中找到不一致的資訊,不受監督式學習就可以讓人工智慧在不確定結果的資訊中找出異常模式。

這時,訓練資料只有輸入項目,然後工程師會要求學習演算法根據相似性來設定權重,將資料分類。舉例來說,像網飛(Netflix)這樣的影音串流服務,就是利用演算法來找出哪些觀眾群有類似的觀影習慣,才好向他們推薦更多節目;但要優化、微調這樣的演算法會很複雜:因為多數人有好幾種興趣,會同時出現在很多組別裡。

影音串流服務利用演算法,進而推薦使用者可能喜歡的節目。圖/Pexels

經過不受監督式學習法訓練的人工智慧,可以找出人類或許會錯過的模式,因為這些模式很微妙、數據規模又龐大。因為這樣的人工智慧在訓練時沒有明定什麼結果才「適當」,所以可以產生讓人驚豔的創新見解,這其實和人類的自我教育沒什麼不同——無論是人類自學或是人工智慧,都會產生稀奇古怪、荒謬無理的結果。

不管是受監督式學習法或不受監督式學習法,人工智慧都是運用資料來執行任務,以發現新趨勢、識別影像或做出預測。在資料分析之外,研究人員想要訓練人工智慧在多變的環境裡操作,第三種機器學習法就誕生了。

-----廣告,請繼續往下閱讀-----

增強式學習:需要理想的模擬情境與回饋機制

若用增強式學習,人工智慧就不是被動地識別資料間的關聯,而是在受控的環境裡具備「能動性」,觀察並記錄自己的行動會有什麼反應;通常這都是模擬的過程, 把複雜的真實世界給簡化了,在生產線上準確地模擬機器人比較容易,在擁擠的城市街道上模擬就困難得多了。

但即使是在模擬且簡化的環境裡,如西洋棋比賽,每一步都還是會引發一連串不同的機會與風險。因此,引導人工智慧在人造環境裡訓練自己,還不足以產生最佳表現,這訓練過程還需要回饋。

西洋棋比賽中的每一步會引發一連串機會與風險。圖/Pexels

提供反饋和獎勵,可以讓人工智慧知道這個方法成功了。沒有人類可以有效勝任這個角色:人工智慧因為在數位處理器上運作,所以可以在數小時或數日之內就訓練自己幾百次、幾千次或幾十億次,人類提供的回饋相比之下根本不切實際。

軟體工程師將這種回饋功能自動化,謹慎精確地說明這些功能要如何操作,以及這些功能的本質是要模擬現實。理想情況下,模擬器會提供擬真的環境,回饋功能則會讓人工智慧做出有效的決定。

-----廣告,請繼續往下閱讀-----

阿爾法元的模擬器就很簡單粗暴:對戰。阿爾法元為了評估自己的表現,運用獎勵功能,根據每一步創造的機會來評分。

增強式學習需要人類參與來創造人工智慧的訓練環境(儘管在訓練過程中不直接提供回饋):人類要定義模擬情境和回饋功能,人工智慧會在這基礎上自我訓練。為產生有意義的結果,謹慎明確地定義模擬情境和回饋功能至關重要。

——本文摘自《 AI 世代與我們的未來:人工智慧如何改變生活,甚至是世界?》,2022 年 12 月,聯經出版公司,未經同意請勿轉載。

聯經出版_96
27 篇文章 ・ 20 位粉絲
聯經出版公司創立於1974年5月4日,是一個綜合性的出版公司,為聯合報系關係企業之一。 三十多年來已經累積了近六千餘種圖書, 範圍包括人文、社會科學、科技以及小說、藝術、傳記、商業、工具書、保健、旅遊、兒童讀物等。

0

0
0

文字

分享

0
0
0
大數據與人道援助 – 群眾標記應用
活躍星系核_96
・2015/02/26 ・3496字 ・閱讀時間約 7 分鐘 ・SR值 598 ・九年級

-----廣告,請繼續往下閱讀-----

作者:潘人豪助理教授,元智大學大數據與數位匯流創新中心

「人道援助」,乍聽這個詞,或許大家腦海中浮出的,是穿著白袍的醫生坐在簡陋環境裡義診,也可能是大批穿著制服協助難民撤逃的軍人們,又或者是寫著UN(United Nations)聯合國的白色四輪驅動越野車奔馳在災區中進行調查支援。有沒有曾經想像過,雲端計算、大數據應用,這樣的前端資通訊技術,也有可能應用在人道援助的場域中呢?

這幾年雲端技術、大數據應用的蓬勃發展,早已深入每一個人日常生活中,更不用說在各個商業領域的前端應用。然而在這樣全球火熱且全面關注的議題中,卻鮮少有人意識到,大數據也同時悄悄的應用到人道援助、國際合作領域中。

每當我們撥出一通電話、購買某個商品、使用社群媒體,甚至僅僅打開網頁瀏覽,都在不知不覺中產生大量資訊,加上自動化感測裝置的連續資料,無論是從政府單位或是私人企業產生儲存,這些無數的大數據資訊源與其交互組合可解釋的問題幾乎可以涵蓋各種議題,而當今的人道援助、國際合作機構,便是企圖利用各種大數據資訊或雲端計算科技,解決當下所面臨的問題,給予目標族群(vulnerable communities)更快速、有效的援助服務。

-----廣告,請繼續往下閱讀-----

然而對於這樣的大數據、雲端服務應用,其實並不是近幾年大數據技術流行才有的,早在2007年,位於東非的肯亞(Kenya)共和國因為俱爭議總統大選後的全國性暴動,種族對立衝突造成超過一千三百人喪生與三十五萬人被迫離開家園躲避內亂。

政府軍隊進行武力鎮壓 (Photo: Evelyn Hockstein, The New York Times)
政府軍隊進行武力鎮壓 (Photo: Evelyn Hockstein, The New York Times   )

肯亞國內Kikuyu 族群民眾抗爭(Photo : Evelyn Hockstein, The New York Times)
肯亞國內Kikuyu 族群民眾抗爭(Photo : Evelyn Hockstein, The New York Times

而在肯亞內亂當時,一群當地程式設計師與網路團體開發出名為Ushahidi計畫,Ushahidi為肯亞當地Swahili語言的證言(testimony)之意,Ushahidi計畫發展出一個網路平台,使用者可以透過手機SMS(Short Message Service)簡訊或網站進行暴力事件通報,隨後Ushahidi平台利用Google map進行地理位置標定,藉此跳脫國內媒體受控制或失去機能的狀態,直接由人民發聲向國際尋求援助,也因為Ushahidi的通報與傳播,國際組織得以快速動員進行人道援助救援與物資提供。

-----廣告,請繼續往下閱讀-----

2008年後Ushahida計畫也擴展為國際人道援助平台,企圖提供全球進行事件通報與群眾標記(crowdmapping),並運用於諸多國家,如美國亞特蘭大(Atlanta)犯罪事件追蹤、印度(Republic of India)與墨西哥(United Mexican States)選舉結果的提報追蹤,甚至是2010年海地(Republic of Haiti)大地震與2011年日本東北大地震(2011 Tōhoku earthquake and tsunami)的事件追蹤標記。

2011年日本東北大地震Ushahidi應用(圖片來源:livedoor news) 右圖:Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools)
2011年日本東北大地震Ushahidi應用(圖片來源:livedoor news

Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools)
Ushahidi 平台介面(圖片來源: Jim Craner , Advancing Your Mission With GIS Tools

此外針對急難應用與災害救援事件,Google藉由其所擁有的計算資源,結合其自家Google App Engine分散計算引擎與儲存架構,以及Picasa 影像平台,於2010年時針對中美洲海地地震提出了Google Person Finder服務,針對災區進行災民尋找與通報服務;該服務後續亦提供之後2010智利(Chile)大地震、2011年日本東北大地震,甚至是前年(2013)於菲律賓造成嚴重災情的海燕颱風等災害救援。而Google Person Finder在2011年日本東北大地震期間曾創下高達六十萬姓名資訊紀錄的規模,堪為短時間內人道援助資訊蒐集彙整之成功案例。

-----廣告,請繼續往下閱讀-----

2010 海地大地震時Google推出之Person Finder服務 (Image from : Wikipedia)
2010 海地大地震時Google推出之Person Finder服務
(Image from : Wikipedia

同樣透過大數據群眾標記進行人道救援案例,還有哈佛醫學院Rumi學者,透過社群媒體進行對傳染疾病傳播於地理位置擴散標定的流行病學研究,該研究發表於2012年American Journal of Tropical Medicine and Hygiene期刊,該作者透過自動網路媒體調查平台HealthMap,針對海地自2010年10月20號爆發霍亂(Cholera)疫情開始100天,紀錄由網路平台HealthMap、Twitter所產生之社群網路與關鍵字”Cholera”相關訊息,並透過訊息自動標定其地理位置,藉由時間推演與地理資訊標的,進一步對照海地政府公共衛生部(Ministère de la Santé Publique et de la Population, MSPP)提供之實際通報個案數據。

其結果發現網路數據的呈現與地理位置分布,符合MSPP所提供之事後通報個案資料分布與趨勢,證明透過社群媒體進行大數據資料探勘之方法,可以以低成本的方式進行傳染性疾病早期偵測,並達到快速反應與提早實施防疫策略之使用,針對醫療發展落後、醫療資訊蒐集傳遞機制不健全之國家 實為一個創新的應用。

Rumi學者透過社群媒體數據所獲得之禍亂發生、擴散分布圖。 (圖片來源  doi:10.4269/ajtmh.2012.11-0597)
Rumi學者透過社群媒體數據所獲得之禍亂發生、擴散分布圖。
(圖片來源 doi:10.4269/ajtmh.2012.11-0597

-----廣告,請繼續往下閱讀-----

發展中國家的公共衛生改善與發展,直接影響該國家人民的生存條件與健康條件,目前各國雖透過社群媒體大數據探勘技術企圖進行早期偵測,但如同文獻與相關報導中所提及,因為城鄉差異過大,資訊能力素養不齊,資料過度集中於高人口密度區域如首都太子港(Port-au-Prince)造成評估上的誤差與偏鄉地區的低估。

2014.02 筆者於Saint-Michel-de-l'Attalaye地區拍攝之霍亂隔離病房
2014.02 筆者於Saint-Michel-de-l’Attalaye地區拍攝之霍亂隔離病房

2014.07 筆者重返Saint-Michel-de-l'Attalaye地區, 該區正爆發霍亂疫情病患擠滿霍亂隔離病房(因病患隱私,未拍攝內部照片)
2014.07 筆者重返Saint-Michel-de-l’Attalaye地區,
該區正爆發霍亂疫情病患擠滿霍亂隔離病房(因病患隱私,未拍攝內部照片)

上述之偏差狀況,由筆者近幾年數度至海地進行人道援助計畫時可得到驗證,今年七月筆者與桃園醫院國際衛生中心再度訪問海地北部Artibonite省之偏鄉Saint-Michel-de-l’Attalaye地區時,遭遇該區域爆發嚴重霍亂疫情,然而時隔2010初次爆發至今已將近三年之久,卻仍無法有效控制疫情散布,原因除了當地缺乏公共衛生工程礎建設、民眾公共衛生教育素養不足外,當地醫療機構僅使用紙本文件進行病患診斷紀錄,缺乏病患追蹤、主動式訊息通報機制,導致衛生單位無法立即獲取第一手疾病資訊以進行疫情防堵,亦是主要原因之一。

-----廣告,請繼續往下閱讀-----

因此如何導入全國醫療資訊傳遞網路,由政府端建立真正醫療大數據平台,進行即時傳染性疾病事件通報、監控、追蹤機制,才是治標治本之道。

2014.07 筆者與桃園醫院國際衛生中心 於海地衛生部(MSPP)進行醫療資訊應用課程
2014.07 筆者與桃園醫院國際衛生中心 於海地衛生部(MSPP)進行醫療資訊應用課程

大數據小辭典:

  • 群眾外包(crowdsourcing):此為《連線》(Wired)雜誌記者Jeff Howe於2006年發明的一個專業術語,用來描述一種新的商業模式透過網際網路上的使用者所組成的群體,進行創意的發想、工作執行與技術問題解決等。參與群眾外包成員,針對特定執行項目大多僅收取小額報酬或無償提供服務,因此建立了一種新的勞動結構。
  • 群眾標記(crowdmapping):透過網際網路、行動裝置,群眾使用者可以於平台上標記任何虛擬化事件資訊,包含文字、影像、視訊多媒體、地理資訊、健康醫療紀錄等等,為群眾外包 (crowdsourcing)的延伸應用。常見的群眾標記服務多與地理資訊系統整合,提供具備地理位址之事件資訊。
  • 社群網路(Social Network):是為一群擁有相同興趣與活動的人連結而成的線上社群。針對這類社群所提供的類服務往往是基於網際網路並為用戶提供各種聯繫、交流的互動通路,如電子信件、即時訊息服務或線上網路平台等。常見社群網路平台Facebook, Twitter, Plurk, Google+, LinkedIn, 人人網, 新浪微博, 騰訊微博, Instagram等等。
  • 社群媒體資料探勘(Social Media Mining):社群媒體資料探勘是透過針對社群網物所產生的資料,所進行的資訊擷取、彙整、分析,企圖取得特殊目的、族群的目標模式,透過統計方法、機器學習、網站分析、網路科學等等不同領域的方法,進行對社群網路資料所產生的龐大數據資料尋找其有意義的應用資訊與現象。
  • 社群網路分析 (Social Network Analysis):有別於社群媒體資料探勘,社群網路分析主要過社群網路上每個使用者與其彼此間的關聯性透過電腦科學中的圖學理論、網路理論,將社群網路的事件關聯轉化為圖學上的節點與線段連接,藉此便可以使用數據分析方法中針對圖學、網路關聯分析技術進行判斷,找出其中的群聚、分類、特殊事件與趨勢等標的。

想了解更多大數據知識,歡迎訂閱元智大學大數據匯流電子報

-----廣告,請繼續往下閱讀-----
文章難易度
活躍星系核_96
752 篇文章 ・ 126 位粉絲
活躍星系核(active galactic nucleus, AGN)是一類中央核區活動性很強的河外星系。這些星系比普通星系活躍,在從無線電波到伽瑪射線的全波段裡都發出很強的電磁輻射。 本帳號發表來自各方的投稿。附有資料出處的科學好文,都歡迎你來投稿喔。 Email: contact@pansci.asia