UnisKB/apps/common/handle/impl/doc_split_handle.py

# coding=utf-8
"""
    @project: maxkb
    @Author：虎
    @file： text_split_handle.py
    @date：2024/3/27 18:19
    @desc:
"""
import io
import re
import traceback
import uuid
from typing import List

from docx import Document, ImagePart
from docx.table import Table
from docx.text.paragraph import Paragraph

from common.handle.base_split_handle import BaseSplitHandle
from common.util.split_model import SplitModel
from dataset.models import Image

default_pattern_list = [re.compile('(?<=^)# .*|(?<=\\n)# .*'),
                        re.compile('(?<=\\n)(?<!#)## (?!#).*|(?<=^)(?<!#)## (?!#).*'),
                        re.compile("(?<=\\n)(?<!#)### (?!#).*|(?<=^)(?<!#)### (?!#).*"),
                        re.compile("(?<=\\n)(?<!#)#### (?!#).*|(?<=^)(?<!#)#### (?!#).*"),
                        re.compile("(?<=\\n)(?<!#)##### (?!#).*|(?<=^)(?<!#)##### (?!#).*"),
                        re.compile("(?<=\\n)(?<!#)###### (?!#).*|(?<=^)(?<!#)###### (?!#).*")]


def image_to_mode(image, doc: Document, images_list, get_image_id):
    for img_id in image.xpath('.//a:blip/@r:embed'):  # 获取图片id
        part = doc.part.related_parts[img_id]  # 根据图片id获取对应的图片
        if isinstance(part, ImagePart):
            image_uuid = get_image_id(img_id)
            if len([i for i in images_list if i.id == image_uuid]) == 0:
                image = Image(id=image_uuid, image=part.blob, image_name=part.filename)
                images_list.append(image)
            return f'![](/api/image/{image_uuid})'


def get_paragraph_element_txt(paragraph_element, doc: Document, images_list, get_image_id):
    try:
        images = paragraph_element.xpath(".//pic:pic")
        if len(images) > 0:
            return "".join(
                [item for item in [image_to_mode(image, doc, images_list, get_image_id) for image in images] if
                 item is not None])
        elif paragraph_element.text is not None:
            return paragraph_element.text
        return ""
    except Exception as e:
        print(e)
    return ""


def get_paragraph_txt(paragraph: Paragraph, doc: Document, images_list, get_image_id):
    try:
        return "".join([get_paragraph_element_txt(e, doc, images_list, get_image_id) for e in paragraph._element])
    except Exception as e:
        return ""


def get_cell_text(cell, doc: Document, images_list, get_image_id):
    try:
        return "".join(
            [get_paragraph_txt(paragraph, doc, images_list, get_image_id) for paragraph in cell.paragraphs]).replace(
            "\n", '</br>')
    except Exception as e:
        return ""


def get_image_id_func():
    image_map = {}

    def get_image_id(image_id):
        _v = image_map.get(image_id)
        if _v is None:
            image_map[image_id] = uuid.uuid1()
            return image_map.get(image_id)
        return _v

    return get_image_id


class DocSplitHandle(BaseSplitHandle):
    @staticmethod
    def paragraph_to_md(paragraph: Paragraph, doc: Document, images_list, get_image_id):
        try:
            psn = paragraph.style.name
            if psn.startswith('Heading'):
                return "".join(["#" for i in range(int(psn.replace("Heading ", '')))]) + " " + paragraph.text
        except Exception as e:
            return paragraph.text
        return get_paragraph_txt(paragraph, doc, images_list, get_image_id)

    @staticmethod
    def table_to_md(table, doc: Document, images_list, get_image_id):
        rows = table.rows

        # 创建 Markdown 格式的表格
        md_table = '| ' + ' | '.join(
            [get_cell_text(cell, doc, images_list, get_image_id) for cell in rows[0].cells]) + ' |\n'
        md_table += '| ' + ' | '.join(['---' for i in range(len(rows[0].cells))]) + ' |\n'
        for row in rows[1:]:
            md_table += '| ' + ' | '.join(
                [get_cell_text(cell, doc, images_list, get_image_id) for cell in row.cells]) + ' |\n'
        return md_table

    def to_md(self, doc, images_list, get_image_id):
        elements = []
        for element in doc.element.body:
            tag = str(element.tag)
            if tag.endswith('tbl'):
                # 处理表格
                table = Table(element, doc)
                elements.append(table)
            elif tag.endswith('p'):
                # 处理段落
                paragraph = Paragraph(element, doc)
                elements.append(paragraph)
        return "\n".join(
            [self.paragraph_to_md(element, doc, images_list, get_image_id) if isinstance(element,
                                                                                         Paragraph) else self.table_to_md(
                element,
                doc,
                images_list, get_image_id)
             for element
             in elements])

    def handle(self, file, pattern_list: List, with_filter: bool, limit: int, get_buffer, save_image):
        try:
            image_list = []
            buffer = get_buffer(file)
            doc = Document(io.BytesIO(buffer))
            content = self.to_md(doc, image_list, get_image_id_func())
            if len(image_list) > 0:
                save_image(image_list)
            if pattern_list is not None and len(pattern_list) > 0:
                split_model = SplitModel(pattern_list, with_filter, limit)
            else:
                split_model = SplitModel(default_pattern_list, with_filter=with_filter, limit=limit)
        except BaseException as e:
            traceback.print_exception(e)
            return {'name': file.name,
                    'content': []}
        return {'name': file.name,
                'content': split_model.parse(content)
                }

    def support(self, file, get_buffer):
        file_name: str = file.name.lower()
        if file_name.endswith(".docx") or file_name.endswith(".doc") or file_name.endswith(
                ".DOC") or file_name.endswith(".DOCX"):
            return True
        return False
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								# coding=utf-8
 								"""
 								    @project: maxkb
 								    @Author：虎
 								    @file： text_split_handle.py
 								    @date：2024/3/27 18:19
 								    @desc:
 								"""
 								import io
 								import re
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								import traceback
 								import uuid
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								from typing import List
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								from docx import Document, ImagePart
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								from docx.table import Table
 								from docx.text.paragraph import Paragraph
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
 								from common.handle.base_split_handle import BaseSplitHandle
 								from common.util.split_model import SplitModel
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								from dataset.models import Image
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								default_pattern_list = [re.compile('(?<=^)# .*|(?<=\\n)# .*'),
 								                        re.compile('(?<=\\n)(?<!#)## (?!#).*|(?<=^)(?<!#)## (?!#).*'),
 								                        re.compile("(?<=\\n)(?<!#)### (?!#).*|(?<=^)(?<!#)### (?!#).*"),
 								                        re.compile("(?<=\\n)(?<!#)#### (?!#).*|(?<=^)(?<!#)#### (?!#).*"),
 								                        re.compile("(?<=\\n)(?<!#)##### (?!#).*|(?<=^)(?<!#)##### (?!#).*"),
 								                        re.compile("(?<=\\n)(?<!#)###### (?!#).*|(?<=^)(?<!#)###### (?!#).*")]
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								def image_to_mode(image, doc: Document, images_list, get_image_id):
 								    for img_id in image.xpath('.//a:blip/@r:embed'):  # 获取图片id
 								        part = doc.part.related_parts[img_id]  # 根据图片id获取对应的图片
 								        if isinstance(part, ImagePart):
 								            image_uuid = get_image_id(img_id)
 								            if len([i for i in images_list if i.id == image_uuid]) == 0:
 								                image = Image(id=image_uuid, image=part.blob, image_name=part.filename)
 								                images_list.append(image)
 								            return f'![](/api/image/{image_uuid})'
 								def get_paragraph_element_txt(paragraph_element, doc: Document, images_list, get_image_id):
 								    try:
 								        images = paragraph_element.xpath(".//pic:pic")
 								        if len(images) > 0:
 								            return "".join(
 								                [item for item in [image_to_mode(image, doc, images_list, get_image_id) for image in images] if
 								                 item is not None])
 								        elif paragraph_element.text is not None:
 								            return paragraph_element.text
 								        return ""
 								    except Exception as e:
 								        print(e)
 								    return ""
 								def get_paragraph_txt(paragraph: Paragraph, doc: Document, images_list, get_image_id):
 								    try:
 								        return "".join([get_paragraph_element_txt(e, doc, images_list, get_image_id) for e in paragraph._element])
 								    except Exception as e:
 								        return ""
 								def get_cell_text(cell, doc: Document, images_list, get_image_id):
 								    try:
 								        return "".join(
 								            [get_paragraph_txt(paragraph, doc, images_list, get_image_id) for paragraph in cell.paragraphs]).replace(
 								            "\n", '</br>')
 								    except Exception as e:
 								        return ""
 								def get_image_id_func():
 								    image_map = {}
 								    def get_image_id(image_id):
 								        _v = image_map.get(image_id)
 								        if _v is None:
 								            image_map[image_id] = uuid.uuid1()
 								            return image_map.get(image_id)
 								        return _v
 								    return get_image_id
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								class DocSplitHandle(BaseSplitHandle):
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								    @staticmethod
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								    def paragraph_to_md(paragraph: Paragraph, doc: Document, images_list, get_image_id):
-												Pr@main@fix bugs (#38)

* fix:  文件上传限制文件大小

* fix: 浮窗模式的LOGO更新

* fix: 上传文档大小扩大到100MB

* fix: 创建完知识库，点击设置页面没有保存按钮

* fix: 修复提示问题
											
										
										
											2024-04-09 07:56:01 +00:00
+								        try:
 								            psn = paragraph.style.name
 								            if psn.startswith('Heading'):
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								                return "".join(["#" for i in range(int(psn.replace("Heading ", '')))]) + " " + paragraph.text
-												Pr@main@fix bugs (#38)

* fix:  文件上传限制文件大小

* fix: 浮窗模式的LOGO更新

* fix: 上传文档大小扩大到100MB

* fix: 创建完知识库，点击设置页面没有保存按钮

* fix: 修复提示问题
											
										
										
											2024-04-09 07:56:01 +00:00
+								        except Exception as e:
 								            return paragraph.text
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								        return get_paragraph_txt(paragraph, doc, images_list, get_image_id)
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								    @staticmethod
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								    def table_to_md(table, doc: Document, images_list, get_image_id):
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								        rows = table.rows
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								        # 创建 Markdown 格式的表格
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								        md_table = '| ' + ' | '.join(
 								            [get_cell_text(cell, doc, images_list, get_image_id) for cell in rows[0].cells]) + ' |\n'
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								        md_table += '| ' + ' | '.join(['---' for i in range(len(rows[0].cells))]) + ' |\n'
 								        for row in rows[1:]:
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								            md_table += '| ' + ' | '.join(
 								                [get_cell_text(cell, doc, images_list, get_image_id) for cell in row.cells]) + ' |\n'
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								        return md_table
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								    def to_md(self, doc, images_list, get_image_id):
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								        elements = []
 								        for element in doc.element.body:
-												fix: 修复【知识库】语雀导出的word，导入知识库是空白的 #1148

											
										
										
											2024-09-20 11:36:13 +00:00
+								            tag = str(element.tag)
 								            if tag.endswith('tbl'):
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								                # 处理表格
 								                table = Table(element, doc)
 								                elements.append(table)
-												fix: 修复【知识库】语雀导出的word，导入知识库是空白的 #1148

											
										
										
											2024-09-20 11:36:13 +00:00
+								            elif tag.endswith('p'):
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								                # 处理段落
 								                paragraph = Paragraph(element, doc)
 								                elements.append(paragraph)
 								        return "\n".join(
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								            [self.paragraph_to_md(element, doc, images_list, get_image_id) if isinstance(element,
 								                                                                                         Paragraph) else self.table_to_md(
 								                element,
 								                doc,
 								                images_list, get_image_id)
 								             for element
-												Pr@main@fix bugs (#41)

* fix: 修复提示问题

* fix: 上传文档限制

* feat: 问题管理

* fix: 修改分段正则,优化分段逻辑

* feat: 问题管理

* fix: word分段支持表格数据

* fix: 问题批量插入去重

* fix: 修复文档问题

* feat: 文档分页优化

* fix: 优化关联问题

* fix: 嵌入样式

											
										
										
											2024-04-10 06:16:56 +00:00
+								             in elements])
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								    def handle(self, file, pattern_list: List, with_filter: bool, limit: int, get_buffer, save_image):
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								        try:
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								            image_list = []
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								            buffer = get_buffer(file)
 								            doc = Document(io.BytesIO(buffer))
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								            content = self.to_md(doc, image_list, get_image_id_func())
 								            if len(image_list) > 0:
 								                save_image(image_list)
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								            if pattern_list is not None and len(pattern_list) > 0:
 								                split_model = SplitModel(pattern_list, with_filter, limit)
 								            else:
 								                split_model = SplitModel(default_pattern_list, with_filter=with_filter, limit=limit)
 								        except BaseException as e:
-												feat: 【知识库】docx支持图片上传 #69 (#267)


											
										
										
											2024-04-26 10:03:02 +00:00
+								            traceback.print_exception(e)
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								            return {'name': file.name,
 								                    'content': []}
 								        return {'name': file.name,
 								                'content': split_model.parse(content)
 								                }
 								    def support(self, file, get_buffer):
 								        file_name: str = file.name.lower()
-												fix: 修复上传文档中后缀为PDF 不识别

											
										
										
											2024-08-27 06:14:51 +00:00
+								        if file_name.endswith(".docx") or file_name.endswith(".doc") or file_name.endswith(
 								                ".DOC") or file_name.endswith(".DOCX"):
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								            return True
 								        return False