熱門資訊> 正文
2026-07-27 11:06
文/中信銀行NLP智能審覈模型研發組
隨着大數據技術的發展,商業銀行金融數據呈指數級增長,基於海量數據的「審計全覆蓋」概念對商業銀行內部審計工作提出較高要求。要適應新形勢下的審計變化,必須加強審計數據應用基礎,充分運用科技手段提高非結構化數據使用效率,進而提升審計工作質效。自然語言處理(NLP)是非結構化數據處理的主要方式,旨在將非結構化的數據轉化為半結構化或結構化形式以便於批量處理和分析,該方法對於商業銀行內部審計擴大審計覆蓋面和提升審計質效具有重要意義。本文基於NLP技術在商業銀行、審計中應用分析,構建NLP智能審覈模型對商業銀行內部業務連續性審計中的「雷同演練」「虛假演練」等進行智能化識別,並對該模型后續應用進行展望。
基於 NLP 技術的研究及在審計領域的應用
1.NLP在商業銀行的主要應用
NLP技術在銀行業的應用廣泛且深入,為銀行業務的智能化和高效化提供了強大的技術支持,其主要應用場景如下。一是客户服務優化。NLP技術依託情感分析與語義理解技術,批量解析客户評價、投訴文本,快速定位服務痛點,幫助商業銀行高效處置客訴問題,持續優化服務質量。二是智能交互升級。依託NLP技術優化人機交互能力,客服機器人可精準理解客户諮詢意圖,開展精準應答,實現擬人化交互與個性化金融產品推薦,全面提升客户服務體驗。三是風控與辦公提效。通過NLP技術整合銀行內外部多類型文本數據,實現關鍵信息自動提取、數據深度挖掘分析,同時挖掘風險線索,降低人工處理成本,助力銀行智能化風控與高效辦公。
2.NLP在審計領域的主要應用
與商業銀行全業務場景的泛化NLP應用不同,審計領域的NLP技術應用聚焦智能化審計能力建設,以深度文本挖掘實現審計工作的智能化升級,核心應用於審計信息智能檢索、審計智能問答等專業場景。馮立夫1(2012)圍繞社保審計從信息檢索和自然語言處理入手,研究審計導引技術的基本理論,並討論實現審計導引系統的關鍵技術。陳偉2等(2018,2019)分別在扶貧審計和IT治理審計中利用Python編程語言實現了基於文本數據分析的大數據審計方法。李猛3等(2019)構建了基於自然語言處理技術的內部審計風險預警框架,以授信業務中的非結構化數據為來源,應用自然語言技術進行解析與覈驗,充分發揮了運用自然語言處理等智能化技術進行內部審計風險預警的效果。隨着技術的不斷發展和完善,智能化NLP模型將突破傳統技術應用侷限,在商業銀行內部審計中發揮越來越重要的作用,為審計工作的智能化、數字化轉型和效率提升提供了強有力的技術支撐。
NLP 智能審覈模型在商業銀行內部審計應用實踐
NLP模型在商業銀行內部審計中對於審計證據的自動化提取與驗證具有重要意義。通過自動化提取關鍵信息、非結構化數據轉換和自動化文檔處理,NLP模型大大提高了審計效率;同時,通過信息比對與驗證、風險點識別與評估和合規性檢查等功能,NLP模型也確保了審計結果的準確性和全面性。這些應用實踐不僅減輕了審計人員的工作負擔,還提高了審計工作的質量和效率。下面以商業銀行內部審計過程中的業務連續性審計為例,詳細介紹NLP技術運用實踐。
1.NLP智能審覈模型構建背景及意義
商業銀行業務連續性管理的主要工作內容是一個系統性的過程,需要銀行從戰略制定、組織架構建立、重要業務識別與風險評估、計劃制定、資源配置、培訓與演練、監督與評估以及與監管部門溝通協調等多個方面入手。業務連續性管理不僅涉及信息系統,還涵蓋業務流程、組織結構、風險管理等多個方面。這種多維性使得審計過程變得複雜,內部審計證據的提取與驗證變得尤為困難。
基於監管關注的業務連續性演練存在「虛假演練」「雷同演練」等情況,結合目前審計人員僅能通過肉眼覈實各級經營機構應急演練記錄和報告的現實困境,內部審計從審計視角推動人工智能在金融行業的普及,着手開發「NLP智能審覈模型」。該模型的研發旨在攻克傳統業務連續性審計中缺乏對大量非結構化數據批量分析手段的審計難點,運用科技手段提升審計質效。
2.NLP智能審覈模型技術實現
商業銀行內部審計積極擁抱高階算法,在各類業務場景中充分發揮高階模型的審計價值。當前,審計人員面臨大量閱卷工作,高階算法代替人工批量識別文本和圖片能夠在很大程度上解放人力,提高工作質效。項目組通過在挖掘環境中部署TensorFlow算法、卷積神經網絡預訓練的ResNet50模型、余弦相似度、中文分詞、Keras預訓練等算法,識別各類報告材料中的文本內容、圖片之間的相似度,協助內部審計人員開展海量非結構化數據之間的相似度檢測。
(1)主要算法簡介。Jieba分詞模型是一款主流中文分詞工具,可精準拆分中文文本詞匯,作為NLP基礎技術,廣泛適配文本分析、關鍵詞提取等場景。
Bag-of-Words(BoW)模型是一種在NLP和信息檢索中廣泛使用的文本表示方法。核心為忽略文本語序與語法結構,僅統計詞匯出現情況與頻次。
ResNet50為深度殘差網絡模型,通過殘差學習解決深度網絡梯度消失/爆炸問題,在圖像分類、目標檢測等視覺任務中應用廣泛。
OpenCV是廣泛使用的開源計算機視覺庫,能實現高效的圖像處理和計算。支持多語言接口,集成各類通用算法,可高效完成圖像處理與視覺計算。
PyTorch基於動態計算圖構建,適配變長序列數據處理,內置自動微分與GPU加速功能,大幅提升深度學習模型訓練效率。
余弦相似度通過向量夾角余弦值衡量樣本差異,可將文本、圖像轉化為特徵向量,實現二者相似度匹配。
歐氏距離用於計算空間向量間直線距離,常與余弦相似度配合,量化文本、圖像特徵向量之間的相似程度。
(2)NLP智能審覈模型流程介紹,具體如圖所示。
圖 NLP智能審覈模型流程示例
數據預處理方面。數據預處理主要包括文件脱密、深度解壓、提取圖文、文件命名優化。
一是文件脱密。針對文件夾中存在文件被加密的情況,使用RPA自動解密工具處理。二是深度解壓。使用zipfile、rarfile、py7zr庫深度遍歷文件夾中存在zip、7z、rar后綴的壓縮包,深度解壓文件。若目錄下已存在同名文件,則不解壓。三是提取圖文。可以處理多種格式文件,包含word、excel、ppt、pdf、圖片等,支持doc、docx、pdf、jpeg、jpg、png等后綴文件。將提取出的圖片和文本分別保存在兩個文件夾中,提取出的圖片命名規則為文件路徑+文件名+序號,保留源格式 ;提取出的文本命名規則為文件路徑+文件名,保存為txt格式。四是文件命名優化。對於源文件夾及源文件命名超過特定字符數要求的情況,需要按一定的規則對過長的文件名進行簡化處理。
圖片處理方面。對圖像進行標準化處理,包括調整大小、中心裁剪、轉換為張量以及歸一化。使用OpenCV計算圖像的顏色直方圖,並進行歸一化,直方圖相似度用於快速過濾不相似的圖像對。再使用預訓練的ResNet50模型提取圖像的高維特徵向量。
一是圖片過濾。按指定的規則對圖片進行過濾。由於文檔中存在大量被提取出的流程圖、小圖標等圖片,會導致大量無效的比對結果。通過涉及圖片大小、透明像素和純白像素佔比等規則過濾圖片,排除無效圖片。二是圖片顏色直方圖初篩。使用OpenCV庫進行圖像預處理,對圖像的顏色空間進行初步提取,再通過顏色直方圖屬性,對比兩個圖片間的色差,排除色差大於指定閾值的圖片對,大幅減少計算量,提高整體效率。三是深度學習儲存對應特徵。使用ResNet50(深度卷積神經網絡架構)結合Pytorch框架,抽取圖片對的邊緣、輪廓、紋理、幾何形狀、相對位置以及全局結構等特徵,並向量化。四是相似度比對。使用sklearn庫通過計算余弦相似度和歐氏距離來對比圖片向量,計算圖片間相似性,並設定權重,確保相似度衡量更全面。
在文本處理方面。從指定目錄中讀取所有文本文件內容,形成一個文本字典。對每個文本進行分詞,並將分詞結果存入語料庫中,供后續的向量化使用。再將分詞后的文本進行詞頻向量化,並計算每對文本之間的余弦相似度。
一是文本過濾。按指定的規則對文本進行過濾,例如將包含某關鍵字的文件過濾,減少處理數據量。二是關鍵詞導入。將目標所需的關鍵詞設置為多個特殊關鍵詞語料庫。如,年份、分支行網點名稱、業務名稱、運維人員等。三是關鍵詞檢測。排除上述關鍵詞,調用對字序列狀態建模比對的Jieba分詞模型對其余文本進行中文分詞,將語料庫中的關鍵詞進行匹配查詢使用情況。使用「Jieba」庫進行中文分詞,有效處理了中文文本的詞語邊界問題,提高了相似度計算的準確性。四是詞頻與結構統計處理。在分詞的基礎上進行詞頻統計,計算每個文本中關鍵詞出現頻率,形成詞頻向量(Bag-of-Words模型),便於之后的相似度比對。五是相似度比對。使用sklearn庫計算余弦相似度和歐氏距離來對比文本向量,計算文本間相似性。
3.NLP智能審覈模型優勢與特點
(1)組合多類算法,實現靈活比對。NLP智能審覈模型利用NLP對文本進行處理,可以對語料庫進行靈活改動,實現高效的文本相似度處理;利用OpenCV和深度網絡共同處理圖像,既兼顧了識別速度又兼顧了對圖像高層次信息相似度的處理,以獲得穩定的預測效果。兩者共同作用使得對多媒介、多格式的信息文本均可以靈活比對相似度。
(2)代碼可移植,可擴展性強。NLP智能審覈模型支持不同的計算機和操作系統使用,在模型開發前即考慮不同平臺對代碼運行的差異化要求,使用標準協議和通用編程語言確保代碼可以在不同系統間有效交互,減少平臺差異導致重複開發成本和維護時間。同時,該模型還不斷適應新的審覈需求,根據制定的運行規則和場景進行靈活調整和擴展,使得模型具備更廣泛的應用基礎。
(3)精簡對比結果,便於模型普及。NLP智能審覈模型提供相似度比對值結果,通過該結果值可以直觀、快速發現文本和圖片的高相似度,為內部審計人員提供有價值的參考。模型結果指向性強、精準度高,便於指導審計人員覈驗模型結果,有利於該智能審覈模型在審計機構內部快速普及。
4.NLP智能審覈模型取得的成效
通過模型在業務連續性審計中針對應急預案和應急演練報告等業務連續性管理材料開展文字和圖片相似度檢驗,可以快速識別重複或相似的文檔,減少人工審覈的工作量,從而提高內部審計工作效率並降低人力成本(詳見表1、表2)。
表1 圖片相似度比較結果示例
表2 文本相似度比較結果示例
截至目前,NLP智能審覈模型累計跑批文件5000余份,包括文本2000余份、圖片3000余個,經過26個小時的模型跑批,初步發現問題線索172條;從大量演練報告中提取出現的疑點數據,時間可縮短90%以上。經覈實,疑點數據基本準確,且能夠準確識別前期審計預埋問題點。
NLP 智能審覈模型應用趨勢分析
1.NLP技術持續迭代優化
隨着NLP技術的不斷發展,后續將通過整合不同來源的數據信息,實現文本、圖像、音頻等多模態數據融合處理,為審計工作提供更加全面和深入的洞察。同時,NLP技術有望進一步提高自身性能,具備更強的語境理解能力和情感分析能力,能夠更準確地理解審計文檔中的含義和意圖,消解語言歧義,從而提高審計工作的精準度。
2.拓展內部審計應用邊界
NLP智能審覈模型能夠幫助內部審計人員自動從大量交易數據和財務數據中提取關鍵信息,並進行比對和分析,以發現潛在的異常情況和風險。這種自動化的分析方式能夠顯著降低人為錯誤的風險,並提升審計的精確度。相似度檢測模型不僅可以用於業務連續性審計,也可進一步拓展至對公、個貸、零售等涉及開展現場檢查作業並要求上傳檢查報告的業務領域,如對公客户貸后檢查、信用卡客户上門「三親」等,通過NLP智能審覈模型實現對虛假檢查、雷同檢查的識別。
3.推動實現風險聯防聯控
銀行業務中,NLP智能審覈模型還可以用於風險管理和合規性檢查。在模型效果成熟后將NLP智能審覈模型逐步推廣至一、二道防線,通過將模型部署在業務連續性、對公授信、個人信貸等需要開展檢查並上傳報告的業務系統中,實現報告上傳即開展相似度檢測,實現風險關口前移,提升各項業務檢查、覈驗真實性的有效提升。
結語
在大數據時代,NLP技術的廣泛應用成為不可逆轉的行業趨勢,助力使用者從海量的非結構化數據中提取有價值的信息,為企業決策提供參考。NLP技術在商業銀行內部審計中的應用,能夠大大提高審計人員工作效率和準確性,顯著降低審計資源佔用和審計成本,提高內部審計工作質效。未來在審計賦能分行發展方面,內部審計將從審計視角繼續推動信息科技化與銀行風險防控的深度融合發展,向一、二道防線推广部署成熟、穩定的NLP智能審覈模型。
儘管NLP技術取得了顯著進展,但仍面臨諸如處理歧義、理解複雜語境、跨語言應用等挑戰。未來的NLP技術發展可能會更加註重深度學習、遷移學習等高級技術的應用,以及提高模型的解釋性和適應性。
NLP智能審覈模型研發組:許達、塗志敏、劉仁杰、張鍇、趙皓瓊、陳俊偉、謝暘傑。
腳註:
1馮立夫,2013 年畢業於哈爾濱工程大學計算機科學與技術學院。
2陳偉,南京審計大學教授、博士生導師,江蘇省審計信息工程重點實驗室副主任,中國審計學會審計教育分會理事,長期深耕審計信息化、大數據審計、智能審計及 IT 治理審計領域。
3李猛,供職於南京銀行,長期專注於銀行業內部審計、風險預警及數字化審計技術應用研究。
參考文獻:
[1] 李猛,朱迎際,莊軼.基於自然語言技術的內部審計風險預警框架構建與應用——以NJ銀行授信業務為例[J].中國內部審計,2019,(06):4-9.
[2] 陳偉,李曉鵬,楊建榮.大數據環境下基於自然語言處理技術的IT治理審計方法[J].財務與會計,2019,(06):69-72.
[3] 陳偉,勾東昇,徐發亮.基於文本數據分析的大數據審計方法研究[J].中國註冊會計師,2018,(11):80-84+3.DOI:10.16292/j.cnki.issn1009-
6345.2018.11.016.
[4] 馮立夫.面向審計過程的審計方法導引技術研究[D].哈爾濱工程大學,2012.
(此文刊發於《金融電子化》2026年5月上半月刊)