FileMarkd 記事
ドキュメントをクリーンな Markdown、構造化 JSON スキーマ、OCR、AI パイプラインへ変換するための実践ガイド。
PDF、Word、画像を変換・構造化・抽出して、人間の読書、LLM、モダンナレッジベースに活用する方法を学びます。
最新の記事
新しいチュートリアル、技術解説、深い分析をエンジニアリングチームから。

JSON ファイルの開き方——そして中身をまるごと解説
JSON ファイルとは何か、JSON ファイルを Windows・Mac・Android・ブラウザで専用ソフトなしで開く方法、波括弧 { ... } の中の文法、そして文書を構造化 JSON に変換する方法を解説します。

PDF を Markdown に変換して AI(ChatGPT・Claude・LLM)で使う
PDF を Markdown に変換して LLM・Claude のコンテキストウィンドウで使う方法を解説。AI モデルが生の PDF ではなく構造化 Markdown を好む理由や、ビジョンパーサと OCR の比較、プロンプト設計と RAG に向けた最適化を紹介します。

Markdown(.md)ファイルとは?開き方もあわせて解説
Markdown(.md)ファイルの正体、Markdown マークアップの仕組み、Windows・Mac・iOS・Android・Web での開き方、そして複雑な PDF や Office 文書をきれいな Markdown に変換する方法を解説します。
ドキュメント変換ガイド
異なるドキュメント形式を、ドキュメント、静的サイト、AI パイプライン用のクリーンな Markdown または機械可読 JSON スキーマに変換する方法を学びます。
PDF → Markdown
数式、表、複数列レイアウトをそのまま保持して、PDF を構造化された Markdown に変換します。
Word → Markdown
脚注、スタイル、見出し、ネストされたリストを保持して、DOCX をクリーンな Markdown に変換します。
Excel → Markdown
列の整列を保持した GitHub 対応 Markdown 表にスプレッドシートを変換します。
画像 → Markdown
OCR でスクリーンショットや写真からテキストと図を抽出し、クリーンな Markdown を出力します。
ドキュメント → JSON
RAG パイプラインと AI 分析向けに、型付き JSON スキーマ、ネスト階層、構造化テーブルレコードを抽出します。
FileMarkd で何ができる?
非構造化ドキュメントを、モダンナレッジスタック対応の Markdown (.md) と構造化 JSON (.json) に変換します。
学術論文
LaTeX 数式、引用、複数列の図を保持して、論文や研究ドキュメントをクリーンな Markdown または構造化 JSON に変換します。
AI & RAG ナレッジベース
RAG パイプライン用にドキュメントを準備。Markdown は意味的な境界を提供し、構造化 JSON はメタデータ付きのチャンク化されたベクトル埋め込みを可能にします。
ドキュメント & ナレッジベース
古い PDF ユーザーマニュアルや DOCX 仕様を、Git ベースの静的サイトジェネレータ向けの構造化 MD、または構造化データカタログ向けの JSON に変換します。
コンテンツ移行
古いアーカイブやベンダーの仕様を、Notion や Obsidian のようなモダンワークフローへ移行、または JSON ペイロードでデータベースに直接取り込みます。
ドキュメント変換を学びませんか?
PDF、Word 文書、スプレッドシート、画像をクリーンな構造化 Markdown と型付き JSON スキーマに変換する包括的なガイドをご覧ください。
よくある質問
Markdown に加えて構造化 JSON をエクスポートできますか?
はい!FileMarkd はデュアルフォーマットエクスポート機能を提供しています。任意のドキュメントを、標準的な CommonMark/GFM Markdown (.md) または型付きの構造化 JSON (.json) のいずれかに変換できます。JSON には、ネストされたセクション階層、テーブル配列、抽出されたメタデータが含まれ、RAG パイプライン、ベクトルデータベース、AI ワークフローへの直接取り込みに最適です。
FileMarkd は PDF の数式をどのように処理しますか?
FileMarkd は、フォントグリフマップまたはニューラルビジョンエンコーダからインラインとディスプレイの LaTeX 数式構文($ と $$)を認識し、Obsidian、Notion、GitHub でサポートされる標準 CommonMark LaTeX を出力し、JSON 出力では構造化された数式表現を出力します。
複数列のスキャンされた論文を変換できますか?
はい。幾何学的レイアウト検出器が列をクラスタリングし、横方向の読み取りや壊れた文章なしに自然な読み順で読み取ります。
生の PDF の代わりに Markdown や JSON を LLM に渡すとトークンを節約できますか?
通常 40% 〜 70% のトークン削減が可能です。余分なヘッダー、重複したページ番号、バイナリフォント記述子が除去され、高密度の意味テキストとクリーンな JSON オブジェクトだけが残ります。