一、收藏了不等于学会了,这个老毛病终于有人认真管了
先说个扎心的事实。我的浏览器收藏夹里躺着两百多个”以后一定看”的教程,网盘里存了几个 G 的课程,微信公众号里”浮窗”挂着七篇长文。真要问我学进去多少——大概就是每次整理收藏夹时那种短暂的道德安慰感。
问题出在哪?不在于资料不够,而在于每个工具都只管学习流程里的一小段:笔记软件管收藏,问 AI 管答疑,刷题软件管测验,视频网站管播放。它们之间互相不认识,你的进度、你的疑问、你上次卡住的那一秒,全都散落在不同的地方。

DeepTutor 想干的事情,就是把这条断掉的链子重新焊上。它是港大数据科学实验室(HKUDS)开源的项目——就是做 LightRAG、AI-Researcher 那批人——定位是 agent-native learning workspace(智能体原生的学习工作空间)。上线节奏相当凶:2025 年 12 月底正式发布,39 天破 1 万 star,111 天破 2 万 star。
二、十种学习模式,一个运行时
这是 DeepTutor 架构上最有意思的决定。常见的 AI 学习产品是这样的:聊天是一个入口,出题是另一个页面,做笔记又是一个 App,每个功能背后都是独立的会话和独立的数据。用久了你会发现,你在 A 功能里说过的困惑,到 B 功能里它完全不知道。
DeepTutor 反过来。Chat、Ask Questions、Quiz、Research、Visualize、Solve、Course Study、Mastery Path、沉浸阅读、沉浸观看——十来种模式共享同一个运行时和会话上下文。你可以在聊天里让它出一套测验,测验里发现薄弱点直接跳到解题模式,解题过程中查你的知识库,查完顺手画张图。切来切去,脚下踩着的是同一块地毯。

这个设计听起来简单,但它是后面所有能力的地基。因为只有上下文连着,”个性化”才不是一句空话——它真的知道你上周在哪道题上栽过跟头。
三、最不一样的地方:记忆是能翻开的
市面上喊”记忆”的产品很多,但绝大多数的记忆是一个黑盒:一段你永远看不到也改不了的向量。DeepTutor 把记忆摊开在桌面上,拆成了三层:
| 层级 | 装的是什么 | 打个比方 |
|---|---|---|
L1 轨迹 |
你和它的全部原始交互记录 | 没整理的草稿纸 |
L2 摘要 |
从轨迹里提炼出的事实与偏好 | 抄在小卡片上的重点 |
L3 综合 |
跨 session 沉淀下来的整体判断 | 最后压成一块的”结论砖” |
关键是这三层全部可见、可编辑,而且有 Memory Graph 把它们串起来——L3 的每条综合结论都能顺着线追回 L1 的原始证据。它凭什么觉得你是”图论薄弱”?点开就能看到依据,不同意还能直接改。

我个人的看法:这一条比”支持多少个模型”重要得多。学习类产品的信任感,恰恰建立在”你的判断我要看得懂、不服可以改”上。把记忆做成黑盒的产品,本质上是在替你决定”你是谁”。
四、知识库不是一种读法,是九种
DeepTutor 的 Knowledge Center 做成了多引擎架构:同一个知识库,底下可以挂 LlamaIndex(默认,hybrid 向量 + BM25)、GraphRAG、LightRAG、PageIndex、WeKnora,甚至直接链上你的 Obsidian vault,还能跟踪 GitHub 仓库和文档站的更新。

这对折腾过 RAG 的人是实打实的友好。同一份资料,问答用 hybrid 检索,梳理概念关系时切 GraphRAG,想要精确引用时换 PageIndex——不用搭四套系统,换一把钥匙就行。文档解析层同样可换:MinerU、Docling、Tika、markitdown 一排备选,扫描版 PDF 和纯文本各有各的解法。
五、看视频学习,卡住的那一秒终于不用滑过去了
Immersive Watching 这个功能我第一次看到描述就觉得”这不就是我一直想要的吗”:把 YouTube 链接贴进去,它给你原生播放器 + 同步字幕,最重要的一点是时间戳锚定——视频第 37 秒没听懂,你的提问就钉在第 37 秒上,AI 回答时知道你在问哪一段。进度可恢复,隐私可增强(管理员还能切自托管 Invidious 实例)。

传统的”看视频学习”是什么体验?暂停、切出去、搜问题、搜着搜着刷了半小时别的东西回来、忘了刚才看到哪。这个功能把”提问”焊死在播放轴上,其实是在帮你对付自己的注意力。
六、活书、Co-Writer,还有一个会打电话的搭子
还有几个功能值得单独点名:
Book(活书)
把你手头的素材(文档、视频、笔记)喂进去,它生成一本可交互的”活书”:书页里混排着测验块、动画块、互动模块,而不是一份从头读到尾的静态文档。读到哪里卡住了,当场做题、当场看动画。

Co-Writer
选区感知的 Markdown 写作:你可以只圈住草稿里的某一段说”这段展开”,它做外科手术式的局部修改,不动你其他的内容。写长文的人应该懂这个体验和”整篇重写”的差距有多大。
Subagents & Partners
这是最”离谱”的部分。DeepTutor 的对话里可以直接调用一批真实存在的 agent 运行时——Claude Code、Codex、Kimi、DeepSeek、opencode 等九种 harness。你的学习问题需要真跑一段代码验证?它自己会”打电话”叫帮手。Partners 则更进一步:一个有持久记忆、挂在 IM 上的学习搭子,官方的形容很妙——”a chat that has a personality and a phone number”(一个有性格、有电话号码的聊天)。
顺手一提它的工程素养:执行代码有三级沙箱回退(Runner 容器 → bubblewrap → 受限子进程),凭证被刻意移出沙箱可达范围,MCP 和 CLI 工具默认拒绝、显式开启。一个学习软件把安全边界想得这么清楚,不太常见。
七、怎么装起来:其实就三行
四种安装路径,最省事的是 PyPI。前提:Python 3.11–3.14,Node.js 20+。
mkdir -p my-deeptutor && cd my-deeptutor pip install -U deeptutor deeptutor init # 交互式配置:端口 + LLM 供应商 + 可选 embedding/搜索 deeptutor start # 启动,默认 http://127.0.0.1:3782
不想污染本地环境就用 Docker,一条命令起一个完整实例:
docker run --rm --name deeptutor \ -p 127.0.0.1:3782:3782 \ -v deeptutor-data:/app/data \ ghcr.io/hkuds/deeptutor:latest
| 方式 | 适合谁 | 一句话点评 |
|---|---|---|
pip install deeptutor |
想快速上手的大多数人 | 不用 clone 仓库,init + start 两条命令 |
| 源码安装 | 想二开 / 读 20 万行架构的人 | 有 [graphrag]、[partners] 等可选 extras |
| Docker 单容器 | 服务器 / NAS 部署 | 只暴露 3782,数据挂卷即可 |
| 纯 CLI 模式 | 终端党 | 不要 Web UI,deeptutor chat 直接聊 |
模型层面它不绑任何一家:OpenAI、Anthropic、Gemini、DashScope 之外,Ollama、LM Studio、llama.cpp、vLLM 这类本地/自托管方案全部在列。API 格式兼容 OpenAI Chat Completions / OpenAI Responses / Anthropic Messages 三种。换句话说,数据完全在自己手里这件事,是认真做到了的。
八、泼点冷水:它适合你吗
夸了这么多,说几句实际的:
- 部署成本低,但用好有门槛。十种模式、九种引擎、三层记忆,意味着配置项非常多。想把它调到自己满意的状态,得花一个周末。只想”打开就能用”的人,可能觉得过于复杂。
- LLM 调用是真金白银。本地部署省的是软件费,不省模型费。重度使用的话,API 开销要心里有数;想省就上 Ollama 跑本地模型,代价是效果打折。
- 迭代快也是双刃剑。仅 2026 年 8 月就发了十几个版本,文档和实际行为之间偶尔会有时间差,遇到问题优先翻 GitHub Discussions 和 issue 区。
所以我的建议是:如果你是长期自学的人——备考、啃教材、刷论文、做技术转型——DeepTutor 值得认真投入,因为它攒的是”你的学习资产”,越用越值钱。如果只是偶尔问两个问题,那用一个轻量的 AI 聊天就够了,不必上这套重装备。
写在最后
这两年我测过的”AI + 教育”产品没有一百也有八十,绝大多数的思路是:把 GPT 包一层皮,加个出题按钮,就叫”个性化学习”。DeepTutor 是少数让我觉得想清楚了”学习是什么”再动手的:学习不是一次问答,是一条绵延几年的、会断片会走神会遗忘的曲线,工具的任务是替你把线头捏住。
一个系统愿意把记忆摊开给你看、把每一层判断都留好证据链、把你的进度精确钉在视频的某一秒上——这种”较真”,比多支持几个模型要珍贵得多。
项目地址:github.com/HKUDS/DeepTutor · 官方文档:deeptutor.info · 论文:arXiv:2604.26962

AI TOOL PUSH
