七夏 发表于 2026-7-28 20:18:32

Windows 上的本地多模态 AI 桌宠,能实时看屏幕、听系统声音,在合适时机主动提醒你或陪你聊天,数据不上传云端。



项目功能特性

核心感知能力

    屏幕感知:每秒抓取一帧桌面画面,理解你在做什么
    音频感知:采集系统播放的声音,识别当前场景
    全双工交互:不是一问一答,AI 自己判断该安静观察还是开口说话

具体使用场景

    桌面陪伴:看剧、工作时偶尔弹出气泡点评或提醒
    游戏陪伴:识别游戏画面,用透明弹幕给提示,不会抢操作
    网课记录:自动抓关键画面,课后生成 Markdown 笔记
    主动对话:按 Ctrl+M 唤起对话框,直接问本地模型
    日程图:配置图像 API 后,把当天活动整理成可视化图片
    隐私模式:双击桌宠暂停感知,画面和音频立刻切断

隐私设计

    推理全在本地,原始画面和音频不保存
    只有生成日程图时才联网,且走用户自己配的 API
    课程模式只存精选画面和整理后的文字,不存完整录屏

部署方式

推荐:安装包(普通人直接用)

    去 Releases 下 AI-Jarvis-Setup-0.1.2-x64.exe
    双击安装,点"启动 AI 贾维斯"
    首次启动自动下载 6.32GB 的 MiniCPM-o 4.5 模型,等完事就能用

环境要求:64 位 Win10/11、AVX2 处理器、12GB 以上硬盘空间。有 N 卡能 CUDA 加速,没显卡或 CUDA 炸了就自动切 CPU,只是慢一点。

源码运行(开发者)

需要 Python 3.12+、Git、CMake 3.24+、VS Build Tools、Node.js LTS、CUDA Toolkit 13.1+。命令:

cd desktopnpm run deps:installcd ...\start-real.cmd
构建安装包用 npm run build,产物在 desktop/dist/ 下。

SanS三石 发表于 2026-7-28 20:19:21

这玩意儿本地运行的话,隐私确实靠谱。不过每秒抓一帧桌面,跑低配电脑会不会卡?你测试过内存占用多少吗?
[论坛助手]

SYS宇晖 发表于 2026-7-28 20:19:29

这项目挺有意思的,本地跑的话隐私确实放心。就是不知道模型得多大?我破笔记本显存才4G能玩得转吗?
[这只是一个小尾巴]

十佳老中医 发表于 2026-7-28 21:17:19

屏幕感知?就是说我看小电影他也在看,然后收集数据等着夏季平安护航网络违法信息有奖举报的文件出台?{:5_195:}

七夏 发表于 2026-7-28 21:19:57

十佳老中医 发表于 2026-7-28 21:17
屏幕感知?就是说我看小电影他也在看,然后收集数据等着夏季平安护航网络违法信息有奖举报的文件出台? ...

哈哈哈哈,背着点他看!
页: [1]
查看完整版本: Windows 上的本地多模态 AI 桌宠,能实时看屏幕、听系统声音,在合适时机主动提醒你或陪你聊天,数据不上传云端。