说实话,每次看到同行写稿子张口闭口就是“OCR技术”,我就觉得咱们这行当有点跟不上趟了,你要是现在还把这东西理解成“拍个照、提取个文字”,那咱俩聊的估计不是同一个物种。
我这两天翻外网资料,脑袋都快被“AI人工智能识别技术”这词儿给绕晕了,你光看英文,什么“Intelligent Character Recognition”(智能字符识别),什么“Optical Character Recognition”(光学字符识别),还有更唬人的“Pattern Recognition”(模式识别)和“Computer Vision”(计算机视觉),好家伙,这一连串名词砸下来,读者不迷糊才怪。
今儿咱不搞学术,就用大白话捋捋,这所谓的“AI识别”到底在玩什么新花样,也别指望我翻译得多严谨,我就是把我看到的、用到的,给你唠唠嗑。
最基础的,大家都知道的,把图片里的字儿抠出来,这个英文叫“OCR”,经典老番,但现在你光会这个,不好意思出门跟人打招呼,现在厉害的是啥?是“语义识别”(Semantic Recognition),这词儿听起来文绉绉的,但说白了,就是AI不光认识这字念啥,还知道这字搁这儿是什么意思。
举个例子,你拍一张餐厅菜单的照片,老技术给你返回一堆字儿:“宫保鸡丁 ¥38 鱼香肉丝 ¥32”,完了,信息给你了,但你还得自己看,现在的新玩法是,AI能直接帮你算出,俩菜加起来人均消费多少,甚至能根据点评数据告诉你哪个菜是招牌,这就不是识别了,这是“理解”。
.jpg)
更离谱的是“多模态识别”(Multimodal Recognition),我一开始看到这个词儿也懵,后来明白了,就是AI不再只看图片,它还能把声音、视频、文字资料揉一块儿处理,你拍个视频,它直接把动态画面里的字、说话的内容、背景音乐的旋律全给你拆解成标签,这事儿搁以前,一个团队得忙活一礼拜,几秒钟出结果。
有朋友可能要问了,那这些花里胡哨的玩意儿,咱们写文章的人用得上吗?太用得上了,我前几天做选题,需要找一堆历史老照片里的文字信息,以前得一张张放大看,眼睛都快瞎了,现在直接扔给一个带“视觉理解”能力的工具,它能直接描述图片内容,甚至能推断出照片拍摄的年代背景,这哪是识别啊,这是考古。
不过呢,我也得给大家泼盆冷水,这玩意儿也不是万能的,尤其碰上那种字迹潦草的手写体,或者故意设计的艺术字,AI有时候也会给你来个“人工智障”的现场表演,我的态度一向是,工具嘛,好用就拿来用,不好用就换一个,别把它当神仙供着。
回到咱们的翻译问题上,你要问我“AI人工智能识别技术”英文到底咋说最地道?我给你的建议是,别死磕一个词,如果是泛指,就说“AI-powered recognition technology”,听着就高级,如果要具体点儿,图像里找字说“OCR”,理解图片内容说“Visual Semantic Understanding”,搞动图的加上“Video Recognition”,关键是看你文章里聊的是哪一块。
好了,今天就唠到这儿,这技术迭代快得跟坐火箭似的,咱写文章的手速,怕是永远追不上代码更新的速度,但没关系,能把复杂的事儿说人话,就是咱们的饭碗,下次再聊点别的黑话,我争取再把它掰开揉碎了喂给你。
(免费申请加入)AI工具导航网

相关标签: # AI人工智能识别技术英文翻译
评论列表 (0条)