網路城邦
上一篇 回創作列表 下一篇   字體:
近乎搞笑的手寫數字影像辨識方法研發挺進中!
2026/08/04 14:54:03瀏覽269|回應0|推薦2

與RD分頭進行的手寫辨識研究進行到第二週了!早上進行了一次內容豐富的線上會議。沒有意外!我的RD是我訓練出來的正規軍!她嘗試努力的方向是找出字體中明顯的長直線線段!譬如7字的上方橫線與往下的直線!接下來就是嘗試找出幾個線段的相關位置關係與交叉點位置等等。

其實她的作法被我完全料中了!我一開始也是這麼想的,我也知道她一定會這麼嘗試,這和她之前做了將近一年的紙箱辨識累積的經驗有關,她已經很熟悉如何從模糊影像中找出最明顯線段的技巧。既然知道她會往這個方向做,我當然就會想跳脫這個框架,往更有創意的方向思考,想找出更直覺更簡單的解法

前面幾篇文章已經有提示了,首先是用封閉曲線目標,如上圖中的紅色區塊,加上可以在Y方向上獨立辨識的垂直向線段,如上圖中的綠色區域!僅僅用這兩種明顯的特徵目標,我就已經建立出鑑別率不錯的邏輯,可以將MNIST0-960個字的訓練資料中的01689五個字接近完美的辨識正確了!

目前的進度就是嘗試建立如上粉紅色框框的目標,也就是像棒棒糖的糖果部分!如果下方有隻棒棒,就把上方的區塊視為一種自訂型態的目標!譬如7字的這個區塊下方(或左方)會有洞,9字的這種方塊只可能右邊有洞,或是根本沒洞!4字的話就是上面有洞,左右都沒洞了!很好玩吧?如果我的博士論文如此研發應該會把教授氣到中風吧?完全沒有學術氣息與美感嘛!甚麼有洞沒洞的?實在難登大雅之堂!但是商用研發就不必管這些的!產品能用好用又省錢就行了

別以為我是開玩笑的!這些怪招真的有用,剛剛發明的棒棒糖目標已經讓我79的交叉誤認問題徹底解決了!目前如果不考慮未定案的245三個字的辨識邏輯,其他七個字各60個手寫案例的辨識正確率已經是百分之百了!就是不但每個字都認得出來,還不會交叉誤認!我想不必一個月這套方法就會完整了!以這批MNIST資料為評量標準,辨識率一定可以突破95%的!

我知道這是新的研發議題,我們也沒有絕對把握能做到讓所有人滿意!即使如此,我還是很在意要盡量節省運算量的大原則!我絕對不想研發出一個必須使用GPU才跑得動的辨識軟體!所以不但不考慮使用CNN(類神經網路)DL(深度學習),連我的RD用的那種找出最佳線段的方法我都不想使用!我如此節省計算量也表示我接下來的研發可以使用更多的邏輯條件做最縝密的狀況檢驗與分析處理!我有很多錢可以用在刀口上嘛!不需要像YOLO一樣因陋就簡的!

如上的逆推運算就無可避免要用到很多浮點運算,內行的都知道:電腦是設計給整數運算用的!整數計算都是飛快,一做浮點計算就會慢好幾倍了!所以目前我實驗中的辨識版本辨識一個28X28畫素的手寫字影像所需不到一個毫秒!即使開發完成的完整版預計也是辨識一個字只要幾個毫秒的!重點就是我的方法不但沒有CNN恐怖的矩陣運算,連浮點數計算都非常少!速度當然就會快到嚇人,也省電省到極致了!

我並不是急著掀鍋蓋沒做好的東西就拿來吹牛,我知道我接下來也可能會碰到重大挫敗,必須整個打掉重做的!研發新議題總是這樣的!所以研發工作才需要很長的時間嘛!我只是整天寫程式太疲勞時,暫時跳出來伸伸懶腰喝杯茶跟各位讀者聊聊天而已!當然也希望獲得一些支持鼓勵啦!即使作研發我也不喜歡閉關很久的!

下面是我問Google AI手寫數字辨識時的回覆!其實我很納悶?如果真的像他們說得那麼容易做到?還有98%的高辨識率欸?那為何我遇到的連續兩家台灣最大的會計軟體公司都不能自行開發出自己合用的軟體?也不過就是辨識發票上手寫的金額與統編而已!那麼大的公司都請不到會做這種「簡單」事情的人嗎?

我想不是他們宣稱的辨識率膨風不實,就是訓練好的模型太龐大複雜,必須用雲端的超級電腦才能跑得動!無法安裝在一般的電腦中運作!須知這種票證辨識是有機密資安考慮的!絕對不能上傳到雲端做辨識的!所以最終的解方一定是輕量級可以安裝在一般電腦,而且還能跑得很快的辨識軟體!這就是我想完成的目標了!我知道用他們說的CNN與DL等方法是一定做不到的!如果可以,會計軟體公司早就使用了!我也就不必忙了!

( 心情隨筆工作職場 )
回應 推薦文章 列印 加入我的文摘
上一篇 回創作列表 下一篇

引用
引用網址:https://classic-blog.udn.com/article/trackback.jsp?uid=yccsonar&aid=191860063