UnisKB/apps/common/handle/impl/doc_split_handle.py

# coding=utf-8
"""
    @project: maxkb
    @Author：虎
    @file： text_split_handle.py
    @date：2024/3/27 18:19
    @desc:
"""
import io
import re
from typing import List

from docx import Document

from common.handle.base_split_handle import BaseSplitHandle
from common.util.split_model import SplitModel

default_pattern_list = [re.compile('(?<=^)# .*|(?<=\\n)# .*'), re.compile('(?<!#)## (?!#).*'),
                        re.compile("(?<!#)### (?!#).*"),
                        re.compile("(?<!#)#### (?!#).*"), re.compile("(?<!#)##### (?!#).*"),
                        re.compile("(?<!#)###### (?!#).*"), re.compile("(?<!\n)\n\n+")]


class DocSplitHandle(BaseSplitHandle):
    @staticmethod
    def paragraph_to_md(paragraph):
        try:
            psn = paragraph.style.name
            if psn.startswith('Heading'):
                return "".join(["#" for i in range(int(psn.replace("Heading ", '')))]) + " " + paragraph.text
        except Exception as e:
            return paragraph.text
        return paragraph.text

    def to_md(self, doc):
        ps = doc.paragraphs
        return "\n".join([self.paragraph_to_md(para) for para in ps])

    def handle(self, file, pattern_list: List, with_filter: bool, limit: int, get_buffer):
        try:
            buffer = get_buffer(file)
            doc = Document(io.BytesIO(buffer))
            content = self.to_md(doc)
            if pattern_list is not None and len(pattern_list) > 0:
                split_model = SplitModel(pattern_list, with_filter, limit)
            else:
                split_model = SplitModel(default_pattern_list, with_filter=with_filter, limit=limit)
        except BaseException as e:
            return {'name': file.name,
                    'content': []}
        return {'name': file.name,
                'content': split_model.parse(content)
                }

    def support(self, file, get_buffer):
        file_name: str = file.name.lower()
        if file_name.endswith(".docx") or file_name.endswith(".doc"):
            return True
        return False
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								# coding=utf-8
 								"""
 								    @project: maxkb
 								    @Author：虎
 								    @file： text_split_handle.py
 								    @date：2024/3/27 18:19
 								    @desc:
 								"""
 								import io
 								import re
 								from typing import List
 								from docx import Document
 								from common.handle.base_split_handle import BaseSplitHandle
 								from common.util.split_model import SplitModel
 								default_pattern_list = [re.compile('(?<=^)# .*|(?<=\\n)# .*'), re.compile('(?<!#)## (?!#).*'),
 								                        re.compile("(?<!#)### (?!#).*"),
 								                        re.compile("(?<!#)#### (?!#).*"), re.compile("(?<!#)##### (?!#).*"),
 								                        re.compile("(?<!#)###### (?!#).*"), re.compile("(?<!\n)\n\n+")]
 								class DocSplitHandle(BaseSplitHandle):
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								    @staticmethod
 								    def paragraph_to_md(paragraph):
-												Pr@main@fix bugs (#38)

* fix:  文件上传限制文件大小

* fix: 浮窗模式的LOGO更新

* fix: 上传文档大小扩大到100MB

* fix: 创建完知识库，点击设置页面没有保存按钮

* fix: 修复提示问题
											
										
										
											2024-04-09 07:56:01 +00:00
+								        try:
 								            psn = paragraph.style.name
 								            if psn.startswith('Heading'):
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								                return "".join(["#" for i in range(int(psn.replace("Heading ", '')))]) + " " + paragraph.text
-												Pr@main@fix bugs (#38)

* fix:  文件上传限制文件大小

* fix: 浮窗模式的LOGO更新

* fix: 上传文档大小扩大到100MB

* fix: 创建完知识库，点击设置页面没有保存按钮

* fix: 修复提示问题
											
										
										
											2024-04-09 07:56:01 +00:00
+								        except Exception as e:
 								            return paragraph.text
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								        return paragraph.text
 								    def to_md(self, doc):
 								        ps = doc.paragraphs
 								        return "\n".join([self.paragraph_to_md(para) for para in ps])
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								    def handle(self, file, pattern_list: List, with_filter: bool, limit: int, get_buffer):
 								        try:
 								            buffer = get_buffer(file)
 								            doc = Document(io.BytesIO(buffer))
-												Pr@main@fix bugs (#27)

* fix: 优化word分段规则

* fix: 去除标题特殊字符

* fix: 对话重新生成问题

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-04-01 06:39:56 +00:00
+								            content = self.to_md(doc)
-												Pr@main@pdf (#23)

* feat: 分段API支持word,pdf

* fix: 通用型知识库支持上传 PDF/DOC 格式的文档#19

---------

Co-authored-by: wangdan-fit2cloud <dan.wang@fit2cloud.com>
											
										
										
											2024-03-29 10:28:05 +00:00
+								            if pattern_list is not None and len(pattern_list) > 0:
 								                split_model = SplitModel(pattern_list, with_filter, limit)
 								            else:
 								                split_model = SplitModel(default_pattern_list, with_filter=with_filter, limit=limit)
 								        except BaseException as e:
 								            return {'name': file.name,
 								                    'content': []}
 								        return {'name': file.name,
 								                'content': split_model.parse(content)
 								                }
 								    def support(self, file, get_buffer):
 								        file_name: str = file.name.lower()
 								        if file_name.endswith(".docx") or file_name.endswith(".doc"):
 								            return True
 								        return False