翻译一页漫画,远不只是把对白换成另一种语言:先要找到文字和气泡,再识别原文、擦掉旧字、补好背景,最后把译文排回去。Koharu用Rust把这些原本分散的步骤串成一条本地流水线,适合在意隐私、运行效率和部署便利的用户。
它没有让单个模型包办整页,而是分阶段调用专门模型:目标检测负责定位文字区域、气泡和清理范围;OCR(光学字符识别)把图片中的对白变成文字;图像修补根据周围画面补回被删除文字后的背景;大语言模型再完成翻译。视觉模型可在本机运行,翻译既可使用本地模型,也能连接远程服务。项目还支持竖排中日韩文字、从右向左排版,以及带可编辑文字的分层PSD导出。
Koharu提供Windows、macOS和Linux预编译版本,并覆盖CUDA、ROCm/HIP、Metal、Vulkan及CPU后备路径。不过项目材料没有披露速度、识别准确率或翻译质量对比,因此目前更值得关注的是它完整、可本地部署的工程路线,而非已经得到验证的性能优势。