使用NOPI读取Word、Excel文档内容

使用NOPI读取Excel的例子很多,读取Word的例子不多。

Excel的解析方式有多中,可以使用ODBC查询,把Excel作为一个数据集对待。也可以使用文档结构模型的方式进行解析,即解析Workbook(工作簿)、Sheet、Row、Column。

Word的解析比较复杂,因为Word的文档结构模型定义较为复杂。解析Word或者Excel,关键是理解Word、Excel的文档对象模型。

Word、Excel文档对象模型的解析,可以通过COM接口调用,此类方式使用较广。(可以录制宏代码,然后替换为对应的语言)

也可以使用XML模型解析,尤其是对于2007、2010版本的文档的解析。

using NPOI.POIFS.FileSystem;
using NPOI.SS.UserModel;
using NPOI.XSSF.UserModel;
using NPOI.XWPF.UserModel;
using System;
using System.Collections.Generic;
using System.Configuration;
using System.IO;
using System.Text;

namespace eyuan
{
  public static class NOPIHandler
  {
    /// <summary>
    ///
    /// </summary>
    /// <param name="fileName"></param>
    /// <returns></returns>
    public static List<List<List<string>>> ReadExcel(string fileName)
    {
      //打开Excel工作簿
      XSSFWorkbook hssfworkbook = null;
      try
      {
        using (FileStream file = new FileStream(fileName, FileMode.Open, FileAccess.Read))
        {
          hssfworkbook = new XSSFWorkbook(file);
        }
      }
      catch (Exception e)
      {
        LogHandler.LogWrite(string.Format("文件{0}打开失败,错误:{1}", new string[] { fileName, e.ToString() }));
      }
      //循环Sheet页
      int sheetsCount = hssfworkbook.NumberOfSheets;
      List<List<List<string>>> workBookContent = new List<List<List<string>>>();
      for (int i = 0; i < sheetsCount; i++)
      {
        //Sheet索引从0开始
        ISheet sheet = hssfworkbook.GetSheetAt(i);
        //循环行
        List<List<string>> sheetContent = new List<List<string>>();
        int rowCount = sheet.PhysicalNumberOfRows;
        for (int j = 0; j < rowCount; j++)
        {
          //Row(逻辑行)的索引从0开始
          IRow row = sheet.GetRow(j);
          //循环列(各行的列数可能不同)
          List<string> rowContent = new List<string>();
          int cellCount = row.PhysicalNumberOfCells;
          for (int k = 0; k < cellCount; k++)
          {
            //ICell cell = row.GetCell(k);
            ICell cell = row.Cells[k];
            if (cell == null)
            {
              rowContent.Add("NIL");
            }
            else
            {
              rowContent.Add(cell.ToString());
              //rowContent.Add(cell.StringCellValue);
            }
          }
          //添加行到集合中
          sheetContent.Add(rowContent);
        }
        //添加Sheet到集合中
        workBookContent.Add(sheetContent);
      }

      return workBookContent;
    }

    /// <summary>
    ///
    /// </summary>
    /// <param name="fileName"></param>
    /// <returns></returns>
    public static string ReadExcelText(string fileName)
    {
      string ExcelCellSeparator = ConfigurationManager.AppSettings["ExcelCellSeparator"];
      string ExcelRowSeparator = ConfigurationManager.AppSettings["ExcelRowSeparator"];
      string ExcelSheetSeparator = ConfigurationManager.AppSettings["ExcelSheetSeparator"];
      //
      List<List<List<string>>> excelContent = ReadExcel(fileName);
      string fileText = string.Empty;
      StringBuilder sbFileText = new StringBuilder();
      //循环处理WorkBook中的各Sheet页
      List<List<List<string>>>.Enumerator enumeratorWorkBook = excelContent.GetEnumerator();
      while (enumeratorWorkBook.MoveNext())
      {

        //循环处理当期Sheet页中的各行
        List<List<string>>.Enumerator enumeratorSheet = enumeratorWorkBook.Current.GetEnumerator();
        while (enumeratorSheet.MoveNext())
        {

          string[] rowContent = enumeratorSheet.Current.ToArray();
          sbFileText.Append(string.Join(ExcelCellSeparator, rowContent));
          sbFileText.Append(ExcelRowSeparator);
        }
        sbFileText.Append(ExcelSheetSeparator);
      }
      //
      fileText = sbFileText.ToString();
      return fileText;
    }

    /// <summary>
    /// 读取Word内容
    /// </summary>
    /// <param name="fileName"></param>
    /// <returns></returns>
    public static string ReadWordText(string fileName)
    {
      string WordTableCellSeparator = ConfigurationManager.AppSettings["WordTableCellSeparator"];
      string WordTableRowSeparator = ConfigurationManager.AppSettings["WordTableRowSeparator"];
      string WordTableSeparator = ConfigurationManager.AppSettings["WordTableSeparator"];
      //
      string CaptureWordHeader = ConfigurationManager.AppSettings["CaptureWordHeader"];
      string CaptureWordFooter = ConfigurationManager.AppSettings["CaptureWordFooter"];
      string CaptureWordTable = ConfigurationManager.AppSettings["CaptureWordTable"];
      string CaptureWordImage = ConfigurationManager.AppSettings["CaptureWordImage"];
      //
      string CaptureWordImageFileName = ConfigurationManager.AppSettings["CaptureWordImageFileName"];
      //
      string fileText = string.Empty;
      StringBuilder sbFileText = new StringBuilder();

      #region 打开文档
      XWPFDocument document = null;
      try
      {
        using (FileStream file = new FileStream(fileName, FileMode.Open, FileAccess.Read))
        {
          document = new XWPFDocument(file);
        }
      }
      catch (Exception e)
      {
        LogHandler.LogWrite(string.Format("文件{0}打开失败,错误:{1}", new string[] { fileName, e.ToString() }));
      }
      #endregion

      #region 页眉、页脚
      //页眉
      if (CaptureWordHeader == "true")
      {
        sbFileText.AppendLine("Capture Header Begin");
        foreach (XWPFHeader xwpfHeader in document.HeaderList)
        {
          sbFileText.AppendLine(string.Format("{0}", new string[] { xwpfHeader.Text }));
        }
        sbFileText.AppendLine("Capture Header End");
      }
      //页脚
      if (CaptureWordFooter == "true")
      {
        sbFileText.AppendLine("Capture Footer Begin");
        foreach (XWPFFooter xwpfFooter in document.FooterList)
        {
          sbFileText.AppendLine(string.Format("{0}", new string[] { xwpfFooter.Text }));
        }
        sbFileText.AppendLine("Capture Footer End");
      }
      #endregion

      #region 表格
      if (CaptureWordTable == "true")
      {
        sbFileText.AppendLine("Capture Table Begin");
        foreach (XWPFTable table in document.Tables)
        {
          //循环表格行
          foreach (XWPFTableRow row in table.Rows)
          {
            foreach (XWPFTableCell cell in row.GetTableCells())
            {
              sbFileText.Append(cell.GetText());
              //
              sbFileText.Append(WordTableCellSeparator);
            }

            sbFileText.Append(WordTableRowSeparator);
          }
          sbFileText.Append(WordTableSeparator);
        }
        sbFileText.AppendLine("Capture Table End");
      }
      #endregion

      #region 图片
      if (CaptureWordImage == "true")
      {
        sbFileText.AppendLine("Capture Image Begin");
        foreach (XWPFPictureData pictureData in document.AllPictures)
        {
          string picExtName = pictureData.suggestFileExtension();
          string picFileName = pictureData.GetFileName();
          byte[] picFileContent = pictureData.GetData();
          //
          string picTempName = string.Format(CaptureWordImageFileName, new string[] { Guid.NewGuid().ToString() + "_" + picFileName + "." + picExtName });
          //
          using (FileStream fs = new FileStream(picTempName, FileMode.Create, FileAccess.Write))
          {
            fs.Write(picFileContent, 0, picFileContent.Length);
            fs.Close();
          }
          //
          sbFileText.AppendLine(picTempName);
        }
        sbFileText.AppendLine("Capture Image End");
      }
      #endregion

      //正文段落
      sbFileText.AppendLine("Capture Paragraph Begin");
      foreach (XWPFParagraph paragraph in document.Paragraphs)
      {
        sbFileText.AppendLine(paragraph.ParagraphText);

      }
      sbFileText.AppendLine("Capture Paragraph End");
      //

      //
      fileText = sbFileText.ToString();
      return fileText;
    }

  }
}

以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持我们。

您可能感兴趣的文章:

  • C#实现DataSet内数据转化为Excel和Word文件的通用类完整实例
  • C#实现将数据导出到word或者Excel中的方法
  • word ppt excel文档转换成pdf的C#实现代码
(0)

相关推荐

  • C#实现DataSet内数据转化为Excel和Word文件的通用类完整实例

    本文实例讲述了C#实现DataSet内数据转化为Excel和Word文件的通用类.分享给大家供大家参考,具体如下: 前不久因为项目的需要写的一个C#把DataSet内数据转化为Excel和Word文件的通用类,这些关于Excel.Word的导出方法,基本可以实现日常须要,其中有些方法可以把数据导出后 生成Xml格式,再导入数据库!有些屏蔽内容没有去掉,保留下来方便学习参考用之. 最后请引用Office相应COM组件,导出Excel对象的一个方法要调用其中的一些方法和属性. using Syste

  • C#实现将数据导出到word或者Excel中的方法

    本文实例讲述了C#实现将数据导出到word或者Excel中的方法.分享给大家供大家参考.具体如下: void OutToWord() { if (dataGridView1.Rows.Count >= 1) { string tempstr =""; Stream myStream; SaveFileDialog dlg =new SaveFileDialog(); dlg.Filter = "(Word文件)*.doc|*.doc"; //dlg.Filte

  • word ppt excel文档转换成pdf的C#实现代码

    复制代码 代码如下: using System;using System.Collections.Generic;using System.ComponentModel;using System.Data;using System.Drawing;using System.Linq;using System.Text;using System.Windows.Forms; using Word = Microsoft.Office.Interop.Word;using Excel = Micro

  • 使用NOPI读取Word、Excel文档内容

    使用NOPI读取Excel的例子很多,读取Word的例子不多. Excel的解析方式有多中,可以使用ODBC查询,把Excel作为一个数据集对待.也可以使用文档结构模型的方式进行解析,即解析Workbook(工作簿).Sheet.Row.Column. Word的解析比较复杂,因为Word的文档结构模型定义较为复杂.解析Word或者Excel,关键是理解Word.Excel的文档对象模型. Word.Excel文档对象模型的解析,可以通过COM接口调用,此类方式使用较广.(可以录制宏代码,然后替

  • js读取本地excel文档数据的代码

    复制代码 代码如下: <script> function readThis(){ var tempStr = ""; var filePath= document.all.upfile.value; var oXL = new ActiveXObject("Excel.application"); var oWB = oXL.Workbooks.open(filePath); oWB.worksheets(1).select(); var oSheet

  • php编程实现获取excel文档内容的代码实例

    1.readexcel.system.php 复制代码 代码如下: <?php /* vim: set expandtab tabstop=4 shiftwidth=4 softtabstop=4: */ /** * A class for reading Microsoft Excel Spreadsheets. * * Originally developed by Vadim Tkachenko under the name PHPExcelReader. * (http://source

  • C#使用NPOI将List数据导出到Excel文档

    NPOI是一个开源的C#读写Excel.WORD等微软OLE2组件文档的项目.使用 NPOI 可以在没有安装 Office 或者相应环境的机器上对 WORD/EXCEL 文档进行读写. 这里简单封装了一个使用NPOI导出Excel的DLL,方便项目使用.步骤如下: 1.NuGet包管理器添加对NPOI和log4net的安装引用 2.添加Excel属性信息类ExcelProperty.cs /// <summary> /// 用于定义导出的excel属性 /// </summary>

  • C#使用NOPI库实现导入Excel文档

    使用NOPI导入Excel文档 NOPI版本:2.3.0,依赖于NPOI的SharpZipLib版本:0.86,经测试适用于.net4.0+ 记录遇到的几个问题 1.NOPI中的IWorkbook接口:xls使用HSSFWorkbook类实现,xlsx使用XSSFWorkbook类实现 2.日期转换,判断row.GetCell(j).CellType == NPOI.SS.UserModel.CellType.Numeric && HSSFDateUtil.IsCellDateFormat

  • libreoffice python 操作word及excel文档的方法

    1.开始.关闭libreoffice服务: 开始之前同步字体文件时间,是因为创建soffice服务时,服务会检查所需加载的文件的时间,如果其认为时间不符,则其可能会重新加载,耗时较长,因此需事先统一时间. 使用时如果需要多次调用,最后每次调用均开启后关闭,否则libreoffice会创建一个缓存文档并越用越大,处理时间会增加. class OfficeProcess(object): def __init__(self): self.p = 0 subprocess.Popen('find /u

  • python实现word文档批量转成自定义格式的excel文档的思路及实例代码

    支持按照文件夹去批量处理,也可以单独一个文件进行处理,并且可以自定义标识符 最近在开发一个答题类的小程序,到了录入试题进行测试的时候了,发现一个问题,试题都是word文档格式的,每份有100题左右,拿到的第一份试题,光是段落数目就有800个.而且可能有几十份这样的试题. 而word文档是没有固定格式的,想批量录入关系型数据库mysql,必须先转成excel文档.这个如果是手动一个个粘贴到excel表格,那就头大了. 我最终需要的excel文档结构是这样的:每道题独立占1行,每1列是这道题的一项内

  • Java实现 word、excel文档在线预览

    java实现办公文件在线预览功能是一个大家在工作中也许会遇到的需求,网上些公司专门提供这样的服务,不过需要收费 如果想要免费的,可以用openoffice,实现原理就是: 通过第三方工具openoffice,将word.excel.ppt.txt等文件转换为pdf文件流: 当然如果装了Adobe Reader XI,那把pdf直接拖到浏览器页面就可以直接打开预览,前提就是浏览器支持pdf文件浏览. 我这里介绍通过poi实现word.excel.ppt转pdf流,这样就可以在浏览器上实现预览了.

  • JSP生成WORD文档,EXCEL文档及PDF文档的方法

    本文实例讲述了JSP生成WORD文档,EXCEL文档及PDF文档的方法.分享给大家供大家参考,具体如下: 在web-oa系统中,公文管理好象不可或缺,有时需要从数据库中查询一些数据以某种格式输出来,并以word文档的形式展现,有时许多word文档保存到数据库中的某个表的Blob字段里,服务器再把保存在Blob字段中的图片文件展现给用户.通过网上查找发现很少有关于此类的文章,现在整理起来供大家参考. 1 在client端直接生成word文档 在jsp页面上生成word文档非常简单,只需把conte

  • Java使用poi包读取Excel文档代码分享

    项目需要解析Excel文档获取数据,就在网上找了一些资料,结合自己这次使用,写下心得: 1.maven项目需加入如下依赖: <dependency> <groupId>org.apache.poi</groupId> <artifactId>poi</artifactId> <version>3.10-FINAL</version> </dependency> <dependency> <gr

随机推荐