引言
你随手捡起桌面上的一张纸,潦潦草草写下几个字,几天后纸不见了。聪明的你想到要将它记录进 Obsidian,但是你看的时候,只见白茫茫的界面和密密麻麻的笔记,脑中充满着“形式主义”,“是不是浪费时间”的话,但是 Obsidian 的优势令你着实不愿放下。OCR?太破。AI?提示词,幻觉。你恼火了,最终丢下了纸片和电脑,扬长而去……但是,这真的是一件无法实现的问题吗?
开始
不,在这几座大山面前,这位 Vimatext 硬是开出了生路。
刚才展示的只是一种使用方法,理论上,除了绘图类,它几乎可以覆盖任何类似的场景,有许多是其它 Obsidian 插件无法实现的。
简介
Vimatext,顾名思义,由图片转为 Obsidian 支持的文本格式。
目前支持两大类图片的识别:一是图床上传去的对链接图片的识别,二是普通的库内图片识别。
对于识别,为了力求效率,我选择放弃了传统的 OCR 模型,而是采用千问的大模型(本来想用 VL,看 VL 快下架了)。
它能对颜色笔、荧光笔、Latex 、表格、便签纸等进行正确的识别。分别转换为 <span>、==、markdown 表格、> [!note]。
(一次处理,保证无二次修改)
其中如果需要合并单元格的表格,推荐下载同系列的 Vtable 进行尝试。
本次特意删除其它 Markdown 语法,防止误识别,望理解。另外,还没有考虑做 PDF 识别,如果实在需要,可以在这里发一条。
使用方法
那么,这样的的好工具,如何使用呢?
- 首先去下载社区插件 BRAT,方便你下载未上架的插件。
- 打开插件设置,点击添加一个新的 Beta 插件。
- 输入
Ming145/Vimatext,选择版本,安装,国内可用,但不是很稳定,有需要但用不了的,也可以在这里发一条告知我,我会发网盘链接。 - 启用插件,打开设置,填入千问的 API-KEY(这个不难吧,获取密钥不写过程了)
- 找到你的图片,它必须插入在笔记里,但无论以什么形式。
- 换行到图片下一行的位置,必须是图片下一行,否则报错。
- 按左侧图标或者按下命令,即可开始转换,它会自动插入文本到笔记中。
这里我不得不强调一点,能通过一个以 https 开头照片链接自动识别是一大特色,其原理在于将图片临时下载至 ~/.obsidian/_ocr_cache/,然后上传图片给千问,千问识别,返回。返回或失败后都会删除临时下载的图片。
结语
最后,大家可去 github地址 看 README 和源码哦,项目已开源。
如果有帮到大家,给论坛点赞、给 github 点 star,是对开发者莫大的鼓励。也欢迎发帖评论,不过因为比较忙,不一定会改好。不要抱太大希望。不过相比这些,我更希望大家能顺顺利利地把这个插件真正用起来!
注:本篇初稿正是由 Vimatext 转换得来,为了大家方便查看,我开了左右分屏,准确率不错,见下图:

