软件格律诗:本期《格物致知 科技发现周刊》继续从开源世界和独立开发者作品中,挑选了一批兼具实用性与创意的项目。从视频关键帧提取、游戏语音输入、浏览器标签切换,到 AI Agent 协作、跨平台 HDR 照片转换和即时通信机器人接入,我们可以看到 AI 与自动化正在不断进入更具体的使用场景。同时,本期还收录了 Smartisan OS 经典图标复刻、AI 相册、卡片笔记、在线图片处理、离线 OCR 以及摄影信息卡生成等工具。无论是想提升效率、整理数字内容,还是寻找一些有趣的设计灵感,希望这一期能让你发现几个值得收藏和亲自尝试的新项目。
核心封面

视频分享
这次一年一度820游戏科学放出《黑神话:钟馗》的实机演示,我最好奇的是这个游戏的叙事方式,感觉会不同于以往,不同于现有游戏市场上所有的叙事结构,甚至会不会出现想诺兰那样的“交叉剪辑”的方式来完成和叙述这个故事呢?
项目推荐
VideoFrameExtractor - 快速从长视频中提取关键镜头
https://github.com/ajiaxi666/VideoFrameExtractor
下载:https://pan.quark.cn/s/b341905257eb
VideoFrameExtractor 是一款面向 Windows 的本地视频镜头检测与关键帧提取工具。它的作用很直接:把一段长视频、广告片或素材片快速拆解成一组可以查看、筛选和导出的关键帧。
对于经常处理视频素材的人来说,最麻烦的事情之一就是反复拖动进度条寻找合适画面。尤其是一段几十分钟甚至更长的视频,想快速了解其中有哪些镜头,往往需要花不少时间逐帧查看。VideoFrameExtractor 通过镜头检测和关键帧提取,把视频内容转化为更容易浏览的图片素材。
它适合视频剪辑、素材整理以及广告片分析等场景。提取后的关键帧可以进行复查、导出和缓存,让原本需要反复播放的视频素材,变成可以快速浏览的视觉索引。
如果你经常面对大量视频,又只是想快速找到“这段视频里到底有什么画面”,这个工具能省掉不少手动拖进度条的时间。

IP as Logo - 把可爱的 IP 压缩成一个真正能用的 Logo
https://github.com/s1dashu/ip-as-logo-skill
下载:https://pan.quark.cn/s/ac137e75f9ca
详细介绍:访问
IP as Logo 是一个专注于 IP 形象与产品 Logo 结合方式的设计 Skill。它的核心思路并不是先画一个复杂可爱的角色,再硬塞进 Logo,而是反过来坚持“Logo First,IP Second”:首先保证它是一个简洁、清晰、容易识别的 Logo,然后再赋予它人格和表情。
整个设计强调极简构成,只保留最有辨识度的轮廓和五官,并尽量减少形状数量,让图标即使缩小之后依然容易辨认。同时采用圆润、浑厚的线条,避免尖锐结构,再加入非常克制的阴影和明暗,让整体保持 Flat-first 的轻拟物质感。
色彩同样被严格控制,通常以单色或双色 IP 为主,加上背景后最多控制在三种主色以内。对于需要设计 App Icon、产品 Logo 或品牌 IP 的场景来说,它解决的是“角色很可爱,但缩小后不像 Logo”的问题。

CraftEcho Icons - 让 Smartisan OS 的经典拟物图标重新出现在 Android 上
https://github.com/gaodeng/CraftEcho-Icons
下载:https://pan.quark.cn/s/e569d64698cd
详细介绍:访问
CraftEcho Icons 是一套面向 Android 启动器的非官方图标包,主要整理和适配 Smartisan OS 曾经极具辨识度的拟物图标设计。
如今手机系统图标越来越趋向扁平化,统一、简洁,但也让很多应用图标失去了过去那种像真实物件一样的细节和质感。Smartisan OS 的图标设计曾经以细腻的材质、光影和拟物风格受到不少用户喜欢,而 CraftEcho Icons 想做的,就是让这些具有“器物感”的图标在新的 Android 设备上继续被使用。
它主要面向喜欢个性化桌面的 Android 用户,尤其适合怀念 Smartisan OS 图标风格的人。通过启动器应用图标包,可以让手机桌面重新拥有一套统一的经典拟物视觉。
这类项目解决的不是效率问题,而是一种数字审美的保存。系统会更新,设备会更换,但一些曾经让人印象深刻的设计,也可以通过开源项目继续留下来。

Cumora - 让 AI Agent 成为聊天群里的正式成员
https://github.com/yetone/cumora
下载:https://pan.quark.cn/s/6be69fe96410
详细介绍:访问
Cumora 是 yetone 开源的一个多 Agent 协作项目,它把 AI Agent 放进类似 Slack 的聊天环境中,让人类和多个 AI 像同事一样进行私聊、群聊和任务协作。
在 Cumora 里,Agent 可以拥有名字、角色和记忆,可以参与频道讨论、认领任务,项目也支持真实邮件通信。它的目标并不只是“在聊天窗口里问 AI 一个问题”,而是尝试构建一个由人类和多个 Agent 共同组成的数字团队。
项目支持两种运行方式:Cumora Cloud 使用云端托管的 Agent,而 BYOA(Bring Your Own Agent)则允许用户在自己的电脑上运行 Agent,并使用本地 Claude Code 或 Codex CLI 等工具。
多 Agent 协作最大的难点之一是上下文和任务冲突。Cumora 为此设计了协调机制,例如避免 Agent 基于过时信息继续回复,并通过任务认领机制减少多个 Agent 重复处理同一件事。
如果一个人使用 AI 是“我问,它回答”,那么 Cumora 想探索的则是另一种模式:人类进入一个聊天室,而里面已经坐着一群随时可以协作的 AI 同事。

kotone - 在游戏里直接用语音输入文字
https://github.com/l1veIn/kotone
下载:https://pan.quark.cn/s/bbb380bd90c0
详细介绍:访问
kotone 是一款专门面向游戏玩家的 Windows 桌面语音输入工具。它的操作方式很简单:按住热键说话,本地进行流式语音转写,松开按键后将文字发送到游戏聊天框。
在游戏过程中输入文字其实是一件挺麻烦的事。特别是在多人游戏里,一边操作角色、一边切换聊天框打字,很容易影响节奏。语音输入虽然不是新技术,但 kotone 将它直接放进了游戏聊天这个具体场景中。
项目使用 Tauri 2、Rust 和 sherpa-onnx 构建,语音识别过程在本机完成,不需要把语音上传到服务器。
它适合需要频繁在游戏内交流,又不想每次停下来敲键盘的玩家。尤其是在需要快速沟通、双手又不方便离开键盘和鼠标的时候,按住热键说一句话,再松开直接发送,会比手动输入更顺畅。

TabFlick - 像 Alt+Tab 一样按使用顺序切换 Chrome 标签页
https://www.lifedever.com/TabFlick/
https://github.com/lifedever/TabFlick
下载:https://pan.quark.cn/s/cd9090956c33
TabFlick 给 Google Chrome 增加了一种更接近 Alt+Tab 的标签页切换方式:不再按照标签栏从左到右的位置切换,而是按照你最近实际使用过的顺序进行切换。
很多人打开几十个标签页之后,真正频繁来回看的可能只有两三个页面。传统标签切换需要不断寻找标签位置,而 TabFlick 会记住你的使用顺序,让最近使用的页面优先出现在切换路径中。
使用时按住 Ctrl 再按 Tab,就可以在最近使用的标签之间移动,同时提供切换器浮层,方便查看当前正在切换的页面。
它特别适合标签页很多,但工作时经常在几个网页之间反复跳转的用户。解决的不是“标签太多”这个问题,而是“我刚才看的那个页面到底在哪里”的问题。

dsh-im - 把 DeepSeek Harness 接入各种聊天软件
https://github.com/xmanrui/dsh-im
详细介绍:访问
dsh-im 是一个用于将 IM 机器人接入 DeepSeek Harness(DSH)的项目。通过扫码或者机器人凭据,可以把 DSH 接入飞书、微信、钉钉、企业微信、QQ、Slack、Telegram、Discord 和 WhatsApp 等多个即时通信平台。
对于 AI Agent 来说,最自然的使用方式未必是专门打开一个网页或终端。有时候,我们更希望直接在平时使用的聊天软件里向 Agent 发送任务,让它在后台执行,再把结果返回到聊天窗口。
dsh-im 做的正是这种连接:把 DSH 从独立的 AI 工作环境,扩展到用户日常已经在使用的 IM 工具中。
它适合正在使用 DeepSeek Harness,同时希望通过聊天软件与 AI Agent 交互的用户。无论是个人工作流还是团队协作,都可以减少“为了使用 AI 再打开一个新工具”的操作。
简单来说,dsh-im 解决的是入口问题:不用专门去找 AI,而是让 AI 直接出现在你原本就在使用的聊天软件里。

XDRemux-Flutter - 让国产手机拍摄的 ProXDR 照片获得更广泛的 HDR 兼容
https://github.com/BeetMan/XDRemux-Flutter
下载:https://pan.quark.cn/s/00d2892f9ae4
详细介绍:访问
XDRemux-Flutter 是一个跨平台的照片转换工具,主要针对 OPPO、一加和 realme 手机拍摄的私有 ProXDR HEIC 照片进行处理,将其转换为标准的 ISO 21496-1 HDR HEIC。
它提供 OPPO 兼容和 Apple 标准两种输出方向。前者重点保留 ColorOS 图库中的编辑能力、原机水印和相机元数据;后者则面向 Apple Photos,使照片能够在 iPhone 上继续使用相关编辑能力。
最新版本还加入了 Apple 摄影风格和 Apple 人像模式等实验性功能,不过项目也明确说明,目前只能确认苹果相册能够识别,实际转换效果的正确性仍无法完全保证。
它适合同时使用 Android 手机和 Apple 设备的摄影用户。不同品牌对于 HDR 照片的实现方式并不完全一致,一张在原手机上显示效果很好的照片,传到其他设备后可能无法正确呈现 HDR。
XDRemux 想解决的就是这种跨平台影像兼容问题,让一张照片能够跨越不同厂商的影像生态继续使用。

Ydisks-Xianyu-Helper - 面向闲鱼多账号的自动发货与消息管理
https://github.com/Christ9038/Ydisks-Xianyu-Helper
下载:https://pan.quark.cn/s/48362761d571
详细介绍:访问
Ydisks-Xianyu-Helper 是一个基于 Go 与 React 构建的闲鱼辅助管理系统,主要提供多账号自动发货和消息回复功能。
对于同时管理多个闲鱼账号的用户来说,重复处理订单、回复咨询和进行发货操作会占用不少时间。尤其是销售数字化商品或需要重复发送固定内容时,大量重复操作很容易变成机械劳动。
这个项目将多账号管理、自动发货和消息回复集中起来,希望把部分重复流程交给系统自动处理。
它适合有多账号管理需求,并且希望减少重复客服和发货操作的用户。相比单纯的浏览器插件,这类独立系统更强调对多个账号和业务流程进行统一管理。
项目解决的核心问题很明确:当账号和订单数量增加之后,如何减少重复操作,把更多时间留给真正需要人工处理的事情。

v2s - 一边听原语言,一边看翻译字幕
https://github.com/franklioxygen/v2s
下载:https://pan.quark.cn/s/d6c85d9be43c
详细介绍:访问
v2s 是一个实时字幕工具,可以将麦克风输入或指定应用的音频转换成简洁的双行字幕条,让用户在当前屏幕上直接看到原语言和目标语言的字幕。
它的使用场景非常直观。例如你正在看一段外语视频、参加语音会议或者收听其他应用中的音频,不想离开当前窗口去复制、翻译或查词,那么 v2s 可以直接把原文和目标语言同时显示出来。
双行字幕的设计让用户能够同时看到原始表达和翻译结果,不只是知道“它翻译成什么”,也可以对照理解原来的语言内容。
它适合语言学习、观看外语视频以及跨语言信息获取等场景。相比传统的“听完再翻译”,v2s 希望把语音理解和翻译直接叠加到正在进行的使用过程里。

TrailSnap - 用 AI 整理旅行照片和出行记忆
https://github.com/LC044/TrailSnap
下载:https://pan.quark.cn/s/df560c210477
详细介绍:访问
TrailSnap 是一款面向旅行记录场景的 AI 相册应用,重点不是单纯保存照片,而是帮助用户记录、整理和重新回顾一次完整的出行经历。
旅行结束后,手机里往往会留下几百甚至几千张照片。真正的问题不是“有没有拍下来”,而是过了一段时间之后,很难再把这些照片重新整理成一次完整的旅程。
TrailSnap 希望通过 AI 处理能力,把照片和旅程信息组织起来,让原本分散在相册里的图片重新成为可以回顾的记忆。
它适合喜欢旅行拍照,同时又不想手动整理大量照片的用户。相比普通相册按照时间简单排列,TrailSnap 更关注照片背后的“旅程”。
它解决的是旅行记录中的一个典型问题:照片越来越多,但真正能够重新回顾和讲述的经历却越来越少。

Blinko - 随时捕捉灵感的 AI 卡片笔记
https://github.com/blinkospace/blinko
下载:https://pan.quark.cn/s/e3f4e9fe1ec7
详细介绍:访问
Blinko 是一个 AI 驱动的卡片笔记项目,面向那些习惯快速记录想法、灵感和零散信息的用户。
很多灵感出现的时间只有几秒钟,如果这时候还要先打开复杂的笔记系统、创建文件夹、选择分类,很容易在真正开始记录之前就把想法忘掉。Blinko 选择卡片式记录方式,让用户先把内容快速捕捉下来,再进行后续组织。
AI 的加入则让笔记不仅仅依赖手动整理,也为后续的信息处理提供了更多可能。
它适合知识工作者、内容创作者以及经常出现零散想法的人。相比强调层级结构和长期规划的大型知识库,Blinko 更关注“先记下来”。
它解决的是一个很简单但经常发生的问题:好点子总是在最不方便记录的时候出现,而等你准备打开笔记软件,它已经忘了。

图映 - 浏览器里的本地图片处理工具
详细介绍:访问
图映是一个在线图片工具,提供图片格式转换、压缩、做图以及 AI 抠图去背景等功能。
它的特点之一是本地处理。对于很多简单的图片操作来说,用户并不一定需要安装 Photoshop 或其他大型软件,也不希望为了压缩一张图片注册账号、上传文件或者等待服务器处理。
图映将这些常见需求集中到网页中,通过浏览器完成处理。无论是图片格式转换、压缩,还是制作简单图片和去除背景,都可以直接打开网页操作。
它适合需要快速处理图片的普通用户、自媒体创作者以及网站编辑。尤其是临时需要转换格式、压缩图片或抠图时,不需要安装额外软件。
对于“我只是想赶紧处理这一张图片”的需求来说,打开浏览器直接完成操作往往已经足够。

RapidOCR - 面向多平台和多语言的离线 OCR 工具
https://github.com/RapidAI/RapidOCR
下载:https://pan.quark.cn/s/1ee4ce3eff69
详细介绍:访问
RapidOCR 是一个完全开源免费的 OCR 工具,支持多平台和多语言,并强调离线部署、运行速度以及兼容性。
OCR 的用途非常广泛,从识别截图里的文字,到处理扫描文档、票据和图片资料,都需要把原本的图像内容转换成可编辑、可搜索的文本。
很多在线 OCR 服务虽然使用方便,但需要上传文件,也可能受到网络、隐私或调用次数限制。RapidOCR 提供的是另一种路线:在本地或自己的环境中部署识别能力。
它适合开发者,以及需要将 OCR 集成到桌面应用、自动化工作流或其他软件中的用户。对于需要处理不同语言和多个平台的场景,离线部署也意味着可以更灵活地控制整个识别流程。
简单来说,如果你需要的是一个可以自己部署、免费使用,并且能够适应不同环境的 OCR 基础能力,RapidOCR 值得关注。

PicFrame - 批量为照片生成精致的摄影信息卡
https://github.com/vincentchyu/PicFrame
下载:https://pan.quark.cn/s/fe31d18ec205
详细介绍:访问
PicFrame 是一个摄影信息卡与水印框架生成工具,可以批量处理文件夹中的照片,为它们生成带有相机、镜头等信息的摄影卡片。
它会读取照片 EXIF 数据,并匹配相机和镜头产品 PNG,同时提取品牌 Logo。背景颜色也可以从照片本身衍生,让最终的信息卡与主图保持统一的视觉关系。
在输出方面,PicFrame 会保留主图原始比例和无损像素细节,支持原始分辨率无损导出,也提供面向小红书、朋友圈等社交平台的压缩输出。
它特别适合摄影爱好者以及需要批量发布照片内容的人。以前想给一组照片统一加上相机型号、镜头信息、水印和设计框架,可能需要逐张在设计软件里处理。
PicFrame 将这些重复工作自动化:选择照片文件夹,读取拍摄信息,再批量生成统一风格的成品卡片和汇总预览图。对于想让摄影作品看起来更完整、更有展示感的人来说,这种工具非常实用。

壁纸分享
下载:https://pan.quark.cn/s/7b8ecf1c0c5e




格物致知|科技发现周刊
评论(0)