發表文章

目前顯示的是有「論文筆記」標籤的文章

[論文筆記]一種基於生物訊號傅立葉轉換的 Deepfake 檢測演算法

論文名稱:A Deepfake Detection Algorithm Based on Fourier Transform of Biological Signal 發表時間:2024 年 6 月 20 日 論文連結:  https://www.sciencedirect.com/org/science/article/pii/S1546221824000511 https://www.techscience.com/cmc/v79n3/57116/html 研究問題: 許多研究人員開發了專注於生物辨識特徵的檢測方法。這些方法利用分類網路來分析遠端光電容積圖(rPPG)訊號的時域和頻域特徵,從而獲得極高的檢測準確度。 在頻域分析中,現有方法通常 僅考慮功率譜密度,而忽略了振幅譜 。 學者們提出透過遠端光電容積圖從多個感興趣區域提取 rPPG 訊號,並使用快速傅立葉變換(FFT)進行處理。生成的 時頻域訊號樣本 被組織成矩陣以創建 矩陣視覺化熱圖(MVHM) ,隨後用於訓練影像分類網路。 核心貢獻: 1.學者們體認到傅立葉轉換作為頻域表示法的重要性,並將人臉影片編碼為矩陣視覺化熱圖(MVHM),以輸入影像分類網路。並於公開資料集 DeepFakeTIMIT 上的實驗顯示,本演算法達到了 99.2% 的準確率,這表明與功率譜密度(PSD)相比,遠端光電容積脈搏波(rPPG)生物特徵訊號的快速傅立葉轉換(FFT)包含更多用於區分真假人臉的判別資訊。 2.空間注意力機制在提升 VGG19 網路性能方面發揮了關鍵作用,增幅高達 9.38 個百分點。 使用的資料集: DeepfakeTIMIT https://www.idiap.ch/en/scientific-research/data/deepfaketimit 筆記: 在時域中,我們可從rPPG 生物特徵訊號去直觀地觀察振幅隨時間變化的情形。其表現出的週期性和波形形狀有效地反映了心臟活動。 在頻域中,訊號主要以兩種形式呈現: 振幅譜:提供對訊號頻率組成的見解,指出哪些頻率最為顯著,或訊號能量主要集中在何處。 功率譜密度(PSD):描述了功率隨頻率分佈的函數,用於識別和分析訊號內的雜訊與振盪。

[論文筆記]FakeCatcher:利用生物訊號偵測合成人像影片

論文名稱:FakeCatcher: Detection of Synthetic Portrait Videos using Biological Signals 發表時間:2020 年 7 月 15 日 作者: 紐約州立大學賓漢頓分校-電腦科學系:Lijun Yin、Umur Aybars Ciftci  Intel Corp:Ilke Demir 論文連結:  https://ieeexplore.ieee.org/document/9141516 https://arxiv.org/abs/1901.02212 發布期刊: IEEE Transactions on Pattern Analysis and Machine Intelligence 研究問題 提出一種透過生物訊號新方法來檢測人像影片中是否有合成內容,作為應對深度偽造威脅的預防性解決方案。 Deepfake影片相較於靜態影像,又多一個時間維度。因此 時序一致性 和 空間一致性 則共同構成偵測真實內容的關鍵先驗條件。 針對來自不同臉部區域的訊號、在影像失真情況下、不同片段長度、來自不同生成器的內容、未見過資料集,以及採用多種維度縮減技術等情境,進行分析。 基於偽造內容無法在時空維度上完整保留生物訊號之特性,學者提出假設:人像影片中隱藏的生物訊號,可作為判定影像真實性的隱含描述符。為驗證並落實此一論點,本文依序完成以下實踐: 首先學者們針對 成對分離問題 進行了 數種訊號變換 ,並達成了 99.39% 的準確度。  其次,學者們透過分析所提出的訊號變換及其對應的特徵集,將這些發現應用於建構一個針對偽造內容的通用分類器。 第三,學者們生成新型訊號地圖,並運用卷積神經網路(CNN)來改進傳統分類器,以提升對合成內容的偵測能力。 提出的方法能達到更顯著高的偵測率,且不受偽造內容的來源、生成器或特性的影響。 核心貢獻: 針對生物訊號的空間相干性與時間一致性,提出訊號轉換的建模方法與實驗驗證,以應用於成對及一般真實性分類。 一種可在真實環境中運作、兼具通用性與可解釋性的深度偽造偵測器。 一種用於訓練神經網路以進行真偽鑑別的創新生物訊號地圖建構方法。 一套多樣化的肖像影片資料集,用以建立一個用於在真實環境中檢測偽造內容的測試平台。 研究背景: 近期偽造人像影片的泛濫,對社會、法律及隱私...

兩階段目標檢測發展史(R-CNN,Fast R-CNN,Faster R-CNN)

圖片
  在探討RCNN之前可以先大概知道一個目標檢測發展歷史時間軸 最早期CNN提出之後,陸續從2014年到2016年雙階段目標檢測的技術陸續被提出。 在目標檢測技術的發展歷程中,兩階段式偵測方法是一個很重要的里程碑。 它的核心概念是:先找出可能存在目標的區域(Region Proposal),再對這些區域進行分類與邊界框回歸。這類方法的代表模型依序包括 R-CNN、Fast R-CNN、Faster R-CNN,可以看出整體演進方向就是:從準確率提升,逐步走向更高效率與端到端訓練。 https://medium.com/nerd-for-tech/research-summary-object-detection-upto-fast-rcnn-43d5944f4f6f 1. R-CNN(Region-Based CNN) 程式實作: 使用Pytorch實作RCNN_何謂IoU?何謂SelectiveSearch? 提出時間:2014 年 作者:Ross Girshick 論文名稱: Rich feature hierarchies for accurate object detection and semantic segmentation 論文連結: Rich feature hierarchies for accurate object detection and semantic segmentation(2014初版8頁) www.cv-foundation.org/openaccess/content_cvpr_2014/papers/Girshick_Rich_Feature_Hierarchies_2014_CVPR_paper.pdf Rich feature hierarchies for accurate object detection and semantic segmentation Tech report (v5)(21頁) https://arxiv.org/abs/1311.2524 R-CNN 是早期兩階段目標檢測的重要代表作,首次明確將 Region Proposal(區域提議) 的概念引入目標檢測流程中。 它先透過 Selective Search 從影像中產生大量大小不一的候選區域(約2000個候選框),再將每一個候選區...

[論文筆記]Deep Learning-Based Short Story Generation for an Image Using the Encoder-Decoder Structure(Visual Story Writer)

圖片
Deep Learning-Based Short Story Generation for an Image Using the Encoder-Decoder Structure https://ieeexplore.ieee.org/abstract/document/9512087/ 研究問題 為解決影像生程說明文字篇幅 過於簡短、死板、單薄 。韓國學者們KYUNGBOK MIN、MINH DANG、HYEONJOON MOON(韓國首爾世宗大學-電腦科學與工程博士)嘗試想透過結合影像描述資料集和人工蒐集故事語料庫,來進行短篇故事描述生成(Short Story Captioning,SSCap)。提出所謂的Visual Story Writer Model,藉此來協助故事創作者找尋靈感。 作者想驗證,是否能從一張圖片出發,不只描述「圖中有什麼」,而是進一步寫出像恐怖或愛情風格的短故事,同時維持語意關聯與上下文一致性。 資料集和前處理 本研究使用兩大資料來源: 1.故事語料庫 作者自行從 Smashwords 線上電子書平台爬取蒐集免費小說,挑選字數超過 20,000 字的作品,以降低雜訊與過短文本影響。最後建立了兩種文類的故事資料集: 愛情(romance):500 篇 恐怖(horror):621 篇 於2021年之前學者們爬取Smashwords線上電子書平台,檔案格式為pdf,因此還需要透過pdf2txt的函式庫來轉換為純文字。接續透過python nlp的函式庫做前處理(論文中僅提到移除空白列),最終會將所有電子書文榜都儲存至單一一份檔案中。 透過一種包含結合循環神經網路(RNN)和encoder-decoder架構的無監督式學習框架。 (2026~至今Smashwords線上電子書平台檔案下載下來都是epub格式,因此解析純文本過程會需要另外研究。) 2.Conceptual Captions 資料集 影像描述資料集選用Google於2018年所釋出的 Conceptual Captions 資料集 ,共 涵蓋超過330萬對image跟captions。 包含超過 330 萬組 image-caption pairs,比 MS-COCO 更大且更具多樣性。 目前官方下載點已經失效。 針對Conceptual Captions 資料集,學者們則是將...

[論文筆記]Skip-Thought Vectors_將句子或片語(而非單詞)向量化

圖片
在導讀此篇論文筆記之前,還需要有RNN、LSTM等先備知識。 https://arxiv.org/pdf/1506.06726 Skip-Thoughts  使用跳躍思維模型 與 word2vec 相當相似是一種自然語言處理模型,但不是一次將個別單詞轉換為向量。 取而代之,將整個句子作為單位轉換為向量。 主要理論是去取得一個自然語言語料庫,並找出哪些句子傾向於彼此相鄰出現,然後訓練一個神經網路,使其能預測哪些句子預期會出現在任何其他句子之前或之後。 研究問題 這項研究試圖解決的核心問題是:如何在這個缺乏標註數據的狀況下,學習出高品質、通用且分佈式的句子表示向量(Distributed Sentence Representations)? 在當時,雖然詞向量(Word Vectors)已經能透過非監督學習取得很好的效果,但句子向量的學習大多仍依賴「監督式任務」(Supervised tasks),例如情感分析或邏輯推理 。 這導致模型學習到的特徵往往只針對特定任務有效,缺乏通用性。雖然 Paragraph Vector 是一種非監督替代方案,但它在測試階段需要進行推論來計算新句子的向量,效率較低 。 作者希望創造一種「隨取隨用」(off-the-shelf)的編碼器,能將任何句子映射成向量,並直接應用於各種下游任務 Skip-Thought Vectors採用的encoder-decoder結構,會先將輸入句子的單詞序列進行編碼,並依序預測前後文句的單詞作為輸出。通過學習句子與其前後文句之間的共現關係,Skip-thought 能夠獲得句子編碼結果的數值向量(Skip-Thought Vector),可視為是對單詞向量合成方法本身的學習。 研究背景 Skip-thought 是由 Ryan Kiros 等人於 2015 年提出的一種深度學習演算法,用於將文檔中的句子表達轉換為數值向量。該演算法的特點在於採用無監督學習方式,因此在學習過程中無需標籤或註解過的文本。只要存在由有序句子組成的文檔,即可基於此進行學習並建立模型。 此篇論文研究的靈感主要來自於詞嵌入模型,但其演算法與 Word2vec 有很大的不同。 在 Word2vec(skip-gram)中,主要是透過對輸入詞彙預測其周邊位置的詞彙,來學習詞彙之間的共現關係。 從詞到句子: 既然 Skip-gram...

[論文筆記]CIDEr: Consensus-based Image Description Evaluation

圖片
  https://www.youtube.com/watch?v=pVlcRbfCL6k 年份:2015年 期刊:CVPR 論文連結: https://arxiv.org/abs/1411.5726 研究問題 當使用自動技術對一幅圖像描述進行評價時,應該與專家的圖像描述一致。常用的一些句子相似度評價度量如基於 BLEU 的機器翻譯評分指標。然而這些方法的結果與人的評價相差很遠。現在介紹的 CIDEr 評估指標則是測量一個句子與一組人為生成真實句子的相似性,可以考慮語法、重點以及精度全部考慮在內。 研究背景 在自然語言處理中,給定一幅圖像,機器自動生成圖像描述具有廣泛的應用。但是如何評價一個圖像機器生成的描述是非常具有挑戰性。現在介紹如何自動評價一幅圖像描述的品質,即基於共識 (consensus-based) 的評價方法。 假如每一幅圖像具有 50 個人工圖像描述,機器生成的圖像描述與這 50 個人工描述進行比較,得到選票多的機器圖像描述為最合適的描述。 這種共識方法要求比較候選描述句子與參考描述句子的相似性比較,所以需要對每一個描述句子定義一個向量描述。使用 n-gram 作為句子特徵描述候選句子和參考句子。 給定一幅圖像,假如有 50 個專家生成的參考句子(R1–R50)描述這幅圖像,有兩個需要評價的候選句子 C1 和 C2, 從參考句子中任意選擇一個句子稱為 A,和 B 與 C 一起構成三元註釋 。我們需要對 B 和 C 進行評價,看哪一個與句子 A 更相似。 共識方法會在 B 和 C 之中選出一個,並使用每一條參考句子與 A 一起形成三元標註。參考句子透過投票給出候選 B 或 C 與參考 A 的相似性評分,最後根據共識評分結果得出:究竟是 B 或 C 與參考 A 更相似。 CIDEr 自動評價一幅圖像 I i I_i I i ​ 的描述品質, 使用共識方法評價一個候選圖像標註 c i c_i c i ​ 匹配一組專家生成圖像描述 S i = { s i 1 , s i 2 , … , s i m } S_i=\{s_{i1}, s_{i2}, \ldots, s_{im}\} 。 首先把候選句子和參考句子中所有的詞映射到它們的 stem 或 root 形式。例如,fishes、fishing、fished 映射為根詞 fish。每個句子都表示為...