【插件发布】Vimatext,专注识别,但远超普通OCR

引言

你随手捡起桌面上的一张纸,潦潦草草写下几个字,几天后纸不见了。聪明的你想到要将它记录进 Obsidian,但是你看的时候,只见白茫茫的界面和密密麻麻的笔记,脑中充满着“形式主义”,“是不是浪费时间”的话,但是 Obsidian 的优势令你着实不愿放下。OCR?太破。AI?提示词,幻觉。你恼火了,最终丢下了纸片和电脑,扬长而去……但是,这真的是一件无法实现的问题吗?

开始

不,在这几座大山面前,这位 Vimatext 硬是开出了生路。

刚才展示的只是一种使用方法,理论上,除了绘图类,它几乎可以覆盖任何类似的场景,有许多是其它 Obsidian 插件无法实现的。

简介

Vimatext,顾名思义,由图片转为 Obsidian 支持的文本格式。

目前支持两大类图片的识别:一是图床上传去的对链接图片的识别,二是普通的库内图片识别。

对于识别,为了力求效率,我选择放弃了传统的 OCR 模型,而是采用千问的大模型(本来想用 VL,看 VL 快下架了)。

它能对颜色笔、荧光笔、Latex 、表格、便签纸等进行正确的识别。分别转换为 <span>==、markdown 表格、> [!note]


(一次处理,保证无二次修改)

其中如果需要合并单元格的表格,推荐下载同系列的 Vtable 进行尝试。

本次特意删除其它 Markdown 语法,防止误识别,望理解。另外,还没有考虑做 PDF 识别,如果实在需要,可以在这里发一条。

使用方法

那么,这样的的好工具,如何使用呢?

  1. 首先去下载社区插件 BRAT,方便你下载未上架的插件。
  2. 打开插件设置,点击添加一个新的 Beta 插件。
  3. 输入 Ming145/Vimatext,选择版本,安装,国内可用,但不是很稳定,有需要但用不了的,也可以在这里发一条告知我,我会发网盘链接。
  4. 启用插件,打开设置,填入千问的 API-KEY(这个不难吧,获取密钥不写过程了)
  5. 找到你的图片,它必须插入在笔记里,但无论以什么形式。
  6. 换行到图片下一行的位置,必须是图片下一行,否则报错。
  7. 按左侧图标或者按下命令,即可开始转换,它会自动插入文本到笔记中。

这里我不得不强调一点,能通过一个以 https 开头照片链接自动识别是一大特色,其原理在于将图片临时下载至 ~/.obsidian/_ocr_cache/,然后上传图片给千问,千问识别,返回。返回或失败后都会删除临时下载的图片。

结语

最后,大家可去 github地址 看 README 和源码哦,项目已开源。
如果有帮到大家,给论坛点赞、给 github 点 star,是对开发者莫大的鼓励。也欢迎发帖评论,不过因为比较忙,不一定会改好。不要抱太大希望。不过相比这些,我更希望大家能顺顺利利地把这个插件真正用起来!

注:本篇初稿正是由 Vimatext 转换得来,为了大家方便查看,我开了左右分屏,准确率不错,见下图:

本人属于准九年级,明年对Obsidian的整理装修就要停下来了,也没有时间耐心抄写,学校都是纸质,有大量笔记纸张需要录入Obsidian。

我的图片都在图床上,不喜欢存本地,想要直接识别以网页链接记录的图片。于是我去市场看了一圈,不出所料,要满足这个需求的OCR插件是没有的。

放下要求,本地呢?尝试了大概10个插件,最后全部卸载了,要么准确率不行,要么不支持移动端,最后只留下一个Taskbone满足最后“压缩版“的需求。但是用着还是不爽,感觉达不到真正的效率的程度。

于是,我打算自己开发一个,本人不懂js,ts语法,于是采用全AI编程,想着做就要做到更好,超过之前的要求。出乎意料,对比之前开发Vtable的时候用Claude code劳民伤财费时间,这次还是非常顺利的。

最初用的智谱清言app,发现上下文少的可怜,最后一问它发现它不知道自己在做什么,第一次报错一个文件80多个,好在即时换掉了。

于是换成了Deepseek应用版,以前我是没那么信任ds的,没想到这次v4flash正式版还有点东西。第一次,修了5个报错就能跑了,非常震撼,没有什么bug。后面修缮,逐步走到了现在这个效果。总共从想法到完全结束(除了发论坛),只花了半天不到的时间。

因为这次确实完成的很快、很顺,所以刚才分享了一下经历,阐述了为什么要开发、怎么开发的,真的,有的时候vibe coding不如复制粘贴……

长且复杂的文本反而建议用flash,效果相差无几,这个论坛帖子就是用flash识别的,速度更快,不易超时报错

【通知】1.0.1更新!支持智谱清言API- KEY,已经发布到Github,欢迎用brat下载尝试

【通知】1.0.2更新!修改一些有误的描述文字