返回市场
洞察库

洞察库

作者:v587d2 星标更新:2025-06-30

项目介绍

Insights Knowledge Base(IKB) MCP Server

>>>中文版

🍭一个免费的即插即用知识库。内置超过10,000份高质量洞察报告,打包为MCP服务器,并提供安全的本地数据存储。

⚠️⚠️ 本项目中收集的所有报告均来自官方研究报告网站上的免费资源。 ⚠️⚠️

功能

  1. 🍾 零配置设计,适用于即插即用。
  2. 🚀 内置 Qwen3-Embedding-0.6B 嵌入模型,相关报告可以通过向量搜索检索。📢 报告详情也可以通过关键词检索搜索。
  3. 🍥 收集了来自麦肯锡、普华永道和贝恩等知名咨询公司的超过100份洞察报告,包括6,000多页报告内容,涵盖70多个主题。
  4. 💎 在MCP客户端中实时在线浏览完整报告。
  5. 🎉 超快速响应:所有函数调用返回通常小于1秒,基于关键词的查询小于150毫秒。
  6. 🎨 将私有本地文档粘贴到library_files文件夹中(如果不存在,请手动创建;名称必须匹配)。在.env中配置VLM模型/参数(例如,VLM_MODEL_NAME=qwen2.5-vl-72b-instruct)以进行本地文档提取、解析和识别。
  7. 🦉 永久免费——无需浪费时间收集报告。通过问题分享可靠且符合版权的资源。
  8. 🔔 承诺每周更新报告;修复错误取决于个人意愿(我不是工程师 🤭)。

截至6月30日的优化

  1. 添加了2000多页报告。

未来方向

  1. 持续更新报告。
  2. 提示工程优化。

最新文件概况

{
    "statistics": {
        "total_files": 174,
        "total_pages": 9320,
        "unique_publishers": 9,
        "unique_topics":  93,
        "last_updated": "2025-06-30T10:08:35.928329"
    },
    "details": {
        "publishers": [
            "",
            "Accenture",
            "BAIN",
            "BCG",
            "CBS",
            "Deloite",
            "McKinsey",
            "PWC",
            "亿欧"
        ],
        "topics": [
            "",
            "AI",
            "AI Agent",
            "非洲",
            "售后市场",
            "亚裔美国人",
            "汽车",
            "航空",
            "美容",
            "商业",
            "化工行业",
            "化学品",
            "中国银行业",
            "中国证券",
            "消费品",
            "脱碳",
            "数字化",
            "ESG",
            "经济",
            "经济与贸易",
            "教育",
            "电动两轮车",
            "就业",
            "能源",
            "欧洲",
            "快消品",
            "时尚",
            "金融",
            "金融科技",
            "金融服务",
            "无肉食品",
            "Z世代",
            "全球银行业",
            "全球能源",
            "全球保险",
            "全球宏观经济",
            "全球材料",
            "全球私人市场",
            "全球贸易",
            "杂货",
            "杂货零售",
            "健康",
            "医疗保健",
            "人力资本",
            "氢",
            "保险",
            "投资",
            "投资管理",
            "劳动力市场",
            "拉丁美洲人",
            "低空经济",
            "奢侈品",
            "并购",
            "海事",
            "媒体",
            "医疗健康",
            "医技",
            "净零",
            "新能源汽车",
            "新时代",
            "包装",
            "支付",
            "宠物食品",
            "人口",
            "电力",
            "私募股权",
            "私人市场",
            "生产力",
            "量子",
            "房地产",
            "零售",
            "零售数字化",
            "零售商",
            "风险",
            "小型企业",
            "智能家居",
            "智能医院",
            "运动用品",
            "可持续性",
            "免税",
            "科技",
            "旅行",
            "卡车",
            "英国",
            "VSOC",
            "财富管理",
            "工作场所",
            "连锁经营"
        ]
    }
}

安装(适合初学者)

💡小贴士:遇到困难?将此页面拖放到LLM客户端(如DeepSeek)获取逐步指导。实际上,这些说明也是由DeepSeek编写的...

先决条件:Python 3.12+(从官方网站下载并添加环境路径)

安装UV:

pip install uv

1. 克隆项目(确认已成功安装Git和Git LFS)

git clone https://github.com/v587d/InsightsLibrary.git
cd InsightsLibrary
git lfs pull

2. 创建虚拟环境

uv venv .venv  # 创建专用虚拟环境

# 激活环境
# Windows:
.\.venv\Scripts\activate
# Mac/Linux:
source .venv/bin/activate

3. 安装核心依赖项

uv install .  # 注意末尾的点表示当前目录

4. 创建环境变量(供将来使用)

notepad .env  # Windows
# 或
nano .env     # Mac/Linux

5. 配置MCP服务器

  • VSCode.Cline

注意:将<Your Project Root Directory!!!>替换为实际根目录。

{
  "mcpServers": {
    "ikb-mcp-server": {
      "command": "uv",
      "args": [
        "--directory",
        "<Your Project Root Directory!!!>",
        "run",
        "ikb_mcp_server.py"
      ]
    }
  }
}
  • Cherry Studio
    • 命令:uv
    • 参数:
--directory
<Your Project Root Directory!!!>
run
ikb_mcp_server.py

向ikb_mcp_server添加私有文档

  1. .env中配置VLM模型和参数:
    VLM_API_KEY=<API Key>
    VLM_BASE_URL=<基础URL> # https://openrouter.ai/api/v1
    VLM_MODEL_NAME=<模型名称> # qwen/qwen2.5-vl-72b-instruct:free
    
  2. 将PDF文档上传到项目根目录下的library_files文件夹。
  3. 手动运行main.py。
# 导航到项目根目录
# 激活虚拟环境
uv run main.py
(InsightsLibrary) PS D:\Projects\mcp\InsightsLibrary> uv run main.py
[INFO] extractor: 初始化PDF提取 | 文件目录:library_files | 页面目录:library_pages
[INFO] extractor: 开始扫描目录:library_files
[INFO] extractor: 发现69个PDF文件
[INFO] extractor: 扫描完成 | 总文件数:69 | 已处理:0 | 失败:0
[INFO] recognizer: 无页面需要处理。
# 数据已更新到数据库
============================================================
确认是否需要创建文本向量嵌入
⚠️ 此过程可能需要大约20分钟
============================================================
创建嵌入?(输入Y或N):
# Y:创建文本向量嵌入
# N:跳过文本向量嵌入并退出程序

许可证

本项目采用MIT许可证。详情见LICENSE文件。

截至6月17日的优化更新

  1. 💡优化了models.py:提高了数据查询效率1000%。
  2. 💡优化了extractor.py:略微提升了PDF提取效率。
  3. 💡优化了recognizer.py:提升了图像理解效率50%。
  4. 💡优化了ikb_mcp_server.py
    • 添加了分页功能。
    • 显示引用文件的本地路径。
  5. 💡添加了MIT许可证(https://github.com/v587d/InsightsLibrary/pull/1#issuecomment-2969226661)
  6. 📦 整个项目包的压缩大小减少了约50%
  7. 💡简化了私有文档处理。
  8. 💡修复了其他已识别的错误。

截至6月22日的优化

  1. 添加了embedder.py:通过本地Qwen3-Embedding-0.6B模型实现文本向量化索引,存储在faiss_index中。
  2. 修改了main.py:实现了闭环工作流程PDFExtractor → IMGRecognizer → Embedder(可选)
  3. 新增@mcp.tool(): get_similar_content_by_rag:通过向量相似度(RAG)查找最相似的文档内容。
  4. 所有管理员上传的报告现在支持在线查看 → 删除了library_files文件夹以减少项目大小。
  5. 添加了2000多页报告。