網路城邦
上一篇 回創作列表 下一篇   字體:小 中 大
我的手寫數字的辨識邏輯小孩都能說清楚的!Google AI有在Follow哦!
2026/10/04 13:12:35瀏覽418|回應0|推薦6

我的手寫數字辨識已經挺進到MNIST標準的97%了!Google AI的說法如上,顯然Google AI有在Follow我最近的研究!當然我之前說過,我不會將目標訂在與那些CNN模型拚搏99%以上的辨識率,因為標準答案有小部分是太主觀有爭議衝突的,所以大約超過98%以上的辨識率高下就沒有實質意義了!我預期應該一個月內可以達標接近合理的98%!

其實我認為大家都放棄使用傳統的Rule-based,紛紛改用CNN等方法,原因只是之前的研究者設計的自定義特徵不夠合理有效,無法更接近人類實際做辨識的思考邏輯!那條過度黏著於優美數學架構之路我也是走過的!總是想著可以將特徵定義做得在數學上顯得四平八穩?譬如將筆畫簡化為向量或幾何圖形之類的!

但是我認為人的腦袋可以如此快速簡潔有效的辨識手寫數字,絕對不是用那些漂亮的數學公式思考的!很顯然的,小學生就開始要用手寫數字做算術,他們也必須看懂老師在黑板上寫的數字!但是他們當然不懂幾何座標或向量等數學理論!你以為他們是如何建構他們的辨識邏輯的呢?

我就是以此角度發想設計我這次的手寫辨識架構的!有點像金庸小說中很經典的一幕,張三豐在重傷時面對強敵來襲,臨場就教會了徒孫張無忌太極拳的精要!一般人學拳是必須跟著套路學招,但是一旦有固定的套路必須嚴謹遵循就是一種限制思考的桎梏了!當張無忌說已經把招式都忘記時,張三丰就說張無忌學會了!

聽起來很玄妙?在我的解讀就是好好掌握基本的概念原則,不要拘泥於太嚴格的形式!如下圖的兩個字其實特徵很像,但是幾乎所有人都會傾向說上面是2下面是3!如果你嘗試問一個小一的學生,逼他說出為什麼會認為這樣?他說出的原因就是我現在日思夜想的程式邏輯了!絕對與向量微積分無關!

他可能會說:「3的尾巴應該比較長,還會明顯的向左彎,甚至翹起來!沒彎過去的應該就不是3而是2了!」我真的就是用這些小朋友的思考方式寫出目前的程式的!我和小朋友的差別只是我懂得精確使用的數學語言(字彙)比他們豐富很多!但是基本的思考方式是一模一樣的!如果我拋不下向量幾何學的學術包袱,我就絕對做不出目前的辨識核心!

相對的,CNN是不管這一套的!他們可以說是直接放棄了做任何辨識邏輯的思考!就讓電腦自己去摸索排列組合嘗試錯誤,他們說電腦經過深度學習一定可以自行產生「辨識率」很高的模型!即使如此,但是效率呢?鐵定是非常低落的!成本呢?一定會被推到高峰的!所以才會帶動GPU產業的發展嘛!

我最近的這個實驗研發也讓我更有信心告訴大家我的觀點!如下所示,辨識速度真的很快!一個字平均只要0.87毫秒!完全不需要GPU的!也就是說,即使大家的辨識率一樣,使用我的軟體不必買昂貴的特殊電腦,還特別省電!計算少當然就不耗電嘛!所以我的努力應該是值得大家支持的!

( 心情隨筆|工作職場 )
回應 推薦文章 列印 加入我的文摘
上一篇 回創作列表 下一篇

引用
引用網址:https://classic-blog.udn.com/article/trackback.jsp?uid=yccsonar&aid=192583444