[비즈한국] 據確認,由釜山大學研究團隊開發並免費提供超過20年的“韓國語拼寫檢查器”遭到了國內一家語言處理企業的約200萬次訪問。由於短時間內大量訪問湧入,甚至導致了服務癱瘓。經調查,該大規模訪問的企業曾有過多年承擔國家課題的經歷。

據“Bizhankook”12日採訪結果顯示,5日下午,國內一家企業對被稱為“釜山大學韓國語拼寫檢查器”的Barun Hangeul進行了約200萬次訪問。該服務平日每天處理約25萬份文件,此次短時間內湧入的大量請求導致了服務中斷。
當時透過大規模訪問完成拼寫檢查的文件被確定為80萬至85萬份。這相當於平時日均處理量的3倍以上。為防止因過度請求導致AWS使用費用激增,Barun Hangeul設定了當訪問量超過一定水平時系統自動停止的機制。5日當天,該安全機制觸發,導致服務中斷。
Barun Hangeul方面認為,這並非正常的個人使用,而是透過自動化的“爬蟲”方式進行的訪問。因為數十萬份文件若由人工逐一輸入檢查幾乎不可能,且請求集中在短時間內來自特定伺服器。特別是該企業利用了過去為使用者預留的舊版介面。在系統停止的次日,該企業再次被發現有相同操作。因此,Barun Hangeul方面認為難以斷定為簡單的失誤或一次性訪問,目前正在調查具體經過。
Barun Hangeul已於10日向涉事企業傳送了內容證明,要求其就大規模訪問的經過和目的進行說明。截至12日,該企業尚未做出回應。據悉,該企業從事拼寫檢查及語言處理相關業務,並非小型企業。他們甚至還有過執行與拼寫檢查及人工智慧學習資料相關的國家課題的經歷。
Barun Hangeul方面懷疑,此次大規模訪問很可能是為了利用高效能系統的輸出結果,對相對較小的模型進行訓練,即所謂的“知識蒸餾(Knowledge Distillation)”。在人工智慧領域,這是一種利用其他系統生成的結果作為學習資料,從而提升模型效能的方法。
韓國語拼寫檢查器遭遇此類異常大規模訪問已非首次。2023年,曾確認過一起案例:透過一個據推測位於京畿道南部地區某公寓的IP,在一個月內進行了500萬次以上的訪問。當時查明,這也是為了深度學習等目的而反覆呼叫檢查器。
Barun Hangeul方面表示:“目前正在核實具體的目的等經過,在未聽取涉事企業解釋的情況下公開資訊,可能會導致錯誤資訊傳播,因此我們對此持謹慎態度。”